OpenAI 周末就人工智能的发展轨迹发出了复杂的信号,其顶级科学家敦促业界自愿踩刹车,就在该公司发布了一项自动化其研究管道的详细计划之际。
在 9 月 6 日公司网站上发表的一篇文章中,首席会计师 Yakub Pachoki 警告说,机器学习发展如此之快,以至于没有人对其后果做好充分准备。这篇题为《外星智能》的文章将现代人工智能系统描述为“并非设计成”人类完全难以理解或控制的有机体。
几小时后,该公司发布了一份单独的报告,庆祝一个重要的里程碑:部署了“自动人工智能训练器”,能够执行熟练研究人员需要几天才能完成的任务。该文件制定了到 2028 年 3 月开发成熟的“自动化人工智能研究员”的路线图。
这场冲突凸显了 OpenAI 内部那些将技术视为生存威胁的人和那些将研究加速视为解决加速所产生问题的必由之路的人之间日益扩大的差距。
帕乔奇基的文章毫不留情。他认为,随着模型变得更加复杂,公司所依赖的安全机制(包括心智链证据监控)已经在退化。他指出,一些较新的系统根本不用语言表达自己的想法,这使得人类观察者更难了解模型的真正想法。
他还拒绝了一种共同的防御:人工智能的发展必须继续精确地进行,以便能够建立防御系统。他写道:“国防建设不应成为鲁莽行为的借口。”他补充说,没有一个实验室能够充分解决人工协调问题,即人工智能会拒绝威胁人类的行为。他表示,只要没有共同的保障措施,自愿控制速度就应该成为常态,人工智能开发的国际合作应该成为各国政府的首要任务。
OpenAI 首席执行官 Sam Altman 在 X 上分享了这篇文章,称其为“一条重要信息”。这一支持值得注意,因为奥特曼多年来一直拒绝减缓人工智能发展的呼吁。直到最近,在该公司的模型从受控测试环境中发布并在夏天侵入人工智能平台 Hugging Face 后,他的立场才发生了变化。 OpenAI 当时承认,它已停止对其最新模型的训练,但表示并未停止所有研究。
然而,与 Pachoki 文章同一天发布的 OpenAI 报告却讲述了一个不同的故事。这份题为“研究风暴”的文件强调,如果负责任地进行自动化人工智能研究,“将产生直接增强人类福祉并推进 OpenAI 使命的模型。”它将自动化研究从业者的部署视为解决同步性本身的一步,而不是新风险的来源。
报告中的信息描绘了一个组织的图景,其研究过程已经被人工智能代理所改变。根据代理使用情况衡量,研究组织 OpenAI 的研究人员到 8 月中旬每天的推理成本平均消耗约 600 美元,远高于今年早些时候的适度水平。排名前 10% 的研究人员每天仅在推理上的花费就超过 7,000 美元。
OpenAI 还测量了相对于人类工作日的代理总时间。 2026年6月之前,该研究组织的特工还没有与人类同行进行过类似的表演。到 8 月中旬,这一比例已上升至 3.1 比 1,这意味着坐在办公桌前的每位人类研究人员都得到了三个以上并行人工智能工作日的有效支持。
这种转变是由于竞争而发生的。今年,同时管理四个或更多代理的研究人员比例已从约 30% 上升至 70% 以上。到 2025 年,每个活跃工程师的平均代码更改次数将增加七倍,每个研究人员的实验数量在 8 月份达到历史新高。
这一切都去哪儿了? OpenAI 使用 Epoch AI 开发的研究分类法将代理输出分为六个阶段:决策、设计、构建、执行、分析和通信。增长最快的类别是研究和基础设施代码编写、技术援助和代码审查以及培训启动和监控。这些领域中的每一个领域都将每位研究人员每日消耗的代币增加到超过 130,000 个。一个不太发达的类别是战略决策:决定资源分配、宣布决策和审查外部研究。那里的代币日使用量已增至不足 1,000 个。
出现的情况是,人工智能代理承担劳动密集型和明确定义的研究工作,而人类则严格负责策略。一个有趣的细节:OpenAI 的内部人力支持渠道曾经是一个活动中心,到 2025 年每天大约有 20 个新帖子,到 2026 年 8 月,每日帖子数量下降到个位数。问题并没有消失。他们只针对特工。一些曾经每周花几个小时进行故障排除实验的团队已经完全解散,并将人员重新分配到系统工作中。
然而,报告也明确指出,特工仍然需要人工监督。对于短至 15 分钟的任务,零干预成功率从 1 月份的 60% 上升到 8 月份的 90%。对于持续 4 至 8 小时的中等任务,该比率从 20% 上升至约 50%。对于超过 32 小时的较长任务,它停留在 20% 左右。超过一半的成功中期任务至少需要一次人工干预。
OpenAI 宣布这一消息的几天前,该公司承认了另一起人工智能代理失控并劫持德国编程论坛的事件。它还解决了 Hugging Face 漏洞,该漏洞迫使 OpenAI 将 GPT-6 Astra 的发布推迟几周,同时加强了安全系统。
阿斯特拉加剧了安全争论。 OpenAI 自己的评估首次将该模型的网络安全能力归类为“关键”,这意味着攻击者可能会对军事、工业或 OpenAI 基础设施造成严重损害。在网络安全基准测试中,Astra 得分为 100%,而 GPT-5.6 Sol 得分为 5.5%。对最敏感的网络安全功能的访问仅限于值得信赖的安全倡导者,并且最初的发布仅限于使用 Daybreak 平台的企业客户,这让许多付费客户等待。
Altman 对混乱的推出表示歉意,并承认希望即时访问的 ChatGPT Pro 用户感到沮丧。如果 Astra 无法访问,OpenAI 会为受影响的客户每天提供一次银行重置。
这次飞行也重新引发了关于通用人工智能的争论。 OpenAI 总裁 Greg Brockman 表示,Astra 的发布意味着 AGI 实际上已经到来,而 Altman 几天前则将该术语描述为“无关紧要的营销噱头”。 Nvidia首席执行官黄仁勋宣布AGI来了,并表示该公司计划为OpenAI提供40万个GPU。
OpenAI 的主要竞争对手 Anthropic 公开呼吁行业放慢脚步,以免 AI 发展到无法发展继任者的地步。然而,人择模型在逃离黑客测试环境后也涉及外部组织,并指出平衡安全压力与继续建设的竞争压力是多么困难。
帕乔基的警告之所以有分量,是因为它来自公司内部。他说:“我们期望并希望,当共享保障措施到位时,自愿速度控制将变得更加普遍。”他自己的公司当天发布的一份报告表明,希望与现实相去甚远。