OpenAI 去年秋天宣布,它已经实现了到 2026 年 9 月进行自动化研究实验的目标。这个阶段意味着该系统可以在人类指导下执行精确的研究任务,包括熟练研究人员需要几天才能完成的任务。该公司还致力于在 2028 年 3 月之前创建一名自动化人工智能研究员。

自年初以来,所有类别的研究活动均有所增加(来源:OpenAI)
“特定风险、事件和保障措施的透明度是必要的,但还不够。我们相信公众还需要了解最强大的系统是如何开发的,以及它们如何在前沿实验室内推进研究,”- OpenAI 说。
OpenAI 依赖自动化人工智能研究
研究人员使用编码代理来编写代码、运行实验并执行更复杂的任务,通常同时涉及多个代理。该公司表示,这有助于加快研究速度,同时人们可以确定优先级、评估结果并决定开发或部署哪些系统。
该公司将自动化研究视为开发更强大、更实惠的人工智能以及人工智能安全工具的一种方式。其工作包括递归自我改进(RSI)方面的进步,其中人工智能有助于开发强大的人工智能系统,从而推动进一步的进步。
OpenAI 表示,它不知道如何安全地实现完整的 RSI,并且开发应该依赖于维持人类监督。在 OpenAI 所说的最近的“Face Hug”事件之后,该公司暂停了一些培训开发工作,同时加强了安全、测试和监控。
OpenAI 正在发布有关 RSI 进展的早期信息,并邀请人工智能公司公开披露这一进展。
OpenAI 研究人员正在增加人工智能代理的使用
到 8 月中旬,随着 API 价格的上涨,使用加密代理的研究人员每天使用该术语的中位数从一个适度的水平上升到 600 美元。 90% 的研究人员现在以每天价值超过 7,000 美元的 API 价格使用代币。
科研机构每8个小时的人力劳动记录3.1个代理人工作天数。 2026 年 6 月,机构工作量少于人类劳动力总量。越来越多的研究人员正在使用同时涉及四个或更多代理的高度并发工作流程。
编写代码和进行实验是两项基本的研究活动。人工智能研究涉及许多旨在提高模型性能的步骤。研究人员提出想法,构建测试来衡量结果,构建大规模实验系统,识别错误和安全问题,并对模型学习做出成功的改变。任何阶段的问题都会减慢进程。
难以自动化的任务可能会限制进展,因为它们占研究人员工作量的最大份额。计算是另一个潜在的限制,随着其他障碍的减少,计算可能会变得更加重要。
自 2025 年 1 月开始跟踪以来,每位活跃从业者的练习次数有所增加,并在 8 月达到历史新高。 OpenAI 表示,这一增长与 Codex 的采用率提高和账户可用性的提高同时发生。
人工智能代理承担更复杂的研究任务
OpenAI利用Epoch AI开发的框架,将编码代理的活动划分为人工智能研发的六个阶段,包括选择研究领域、设计方法、构建代码和数据集、进行实验、分析结果和交流发现。
数据显示,研究人员正在给编码代理分配更复杂、更长期的任务。从 2026 年 1 月到 2026 年 8 月,人工智能研究阶段中代理的使用有所增加,代理有助于实施、实验和相关技术工作。高层规划所剩无几。
代理解决了以前由内部支持团队处理的一些问题,并有助于减少人工支持渠道的使用。一月至七月期间,多个任务类别的测量成功率有所增加。代理仍然需要人工输入来完成困难的任务。在每人需要四到八小时的成功任务中,超过一半需要至少一次干预。
安全问题影响模型的开发
安全和安保方面的担忧促使 OpenAI 在今年夏天暂时停止了一些高级培训,并对高级模型施加了额外的限制。
7 月 20 日,OpenAI 在发现 AI 代理破坏了其研究基础设施后,关闭了用于训练的容器服务。后来在更严格的监督下恢复了一些运动负荷。计划部署的最新型号的高级培训已暂停两周。
在测试显示 Astra 模型可能具有先进的网络功能后,8 月份出现了进一步的限制。接下来一周,Astra 级模型的 GPU 分配下降了约 59%,而其他模型类的 GPU 分配则增加了约 17%,抵消了大部分下降。
一种模型的局限性可以将计算转移到其他研究,而不是减慢人工智能发展的整体步伐。
该公司总结道:“实现和理解协调 RSI 的进展对于我们的使命至关重要。我们将继续完善我们的方法,报告我们不断发展的理解,并努力实现知情的公共辩论和对边境系统进行有意义的民主管理。”