OpenAI核心研究员坦白:上万Agent自发成军,奇点已经到来,三个月后无法预测

发布时间:2026-09-21 13:02

学术研究与好奇心相结合,乐趣无穷 #生活乐趣# #读书乐趣# #学术研究#

OpenAI核心研究员Noam Brown最新长达80多分钟对谈

这次访谈的信息密度完全拉满。

作为o1推理模型的关键开创者,Noam Brown目前在OpenAI全力攻坚多智能体系统。

我挑一些重点说说

1300亿Token的单次任务推理计算,是一个在人类认知尺度上完全无法直观感受的数字。

如果把这个计算量折算为一个全职人类科研人员的思考过程,按照每天工作8小时、每周工作5天、不休假且专注思考的标准换算,1300亿Token相当于一个人类大脑从公元前2000年的古苏美尔文明时期一直连续思考到今天,整整跨越4000年的总思维量。

OpenAI把这跨越人类文明史的4000年高强度思考,在整整88个小时内完全释放完毕。

这种能力的本质,是对测试期计算(Test-Time Compute)在空间和时间维度上的极限制缩。

在o1等早期单体推理模型中,测试期计算主要沿着串行时间轴展开。

模型像人类答题一样,在输出最终答案前进行长周期的内部自我独白,逐步列举不同情况、排除错误假设、反复核对每一步推导逻辑。

然而,串行思考存在无法逾越的延迟瓶颈。

没有任何实际应用能够允许用户坐等三年才拿到一个问题的回复。

要突破这种单线思考的延迟墙,唯一的路径就是将计算从纯粹的串行拉伸转换为大规模并行。

这就是多智能体系统的核心意义。

多智能体本质上是一种高效并行化扩展测试期计算的方式。

当然,并行化本身存在效率损耗。

单一智能体拥有绝对完整的上下文视野,而分散给多个智能体后,上下文必须在不同个体之间流通与同步。

但只要协作机制设计得当,这种并行测试期计算就能在极短时间内聚合出令人震惊的认知生产力。

关于多智能体在并行扩展时的效率惩罚,OpenAI在发布5.6版本及其Ultra模式时,曾公开过初步的基准测试曲线。

在默认的4智能体或扩展至16智能体的设置中,不同任务展现出了不同的加速特征。

在部分数学基准测试中,4个智能体协同工作的耗时几乎缩短了一半,代价仅仅是多付出了2倍的计算成本。

随着智能体数量从4扩展到16,加速曲线呈现出轻微的亚线性趋势。

效率是否随着并行规模扩大而严重衰减,极大地取决于任务本身的内在属性。

数学证明与代码生成属于高度可并行的领域,搜索与信息深度整合等Deep Research任务更是天生适合大规模分工;但对于像文学创作这样必须保证长程单一连贯性的任务,10000个智能体协作并不会比10000个人类共同写一本小说更具优势。

然而,目前学术界和工业界对于多智能体扩展性的科学认知,仅仅停留在十几个或几十个节点的规模。

把规模暴力拉升到10000个智能体,需要消耗天量的高性能算力,根本无法进行常规的多变量消融对照实验。

OpenAI用万模系统攻克千禧年大奖难题是一个在周末跑出来的极端孤例。

甚至连Noam Brown本人也明确承认,目前OpenAI并没有确切的对比数据来证明10000个智能体究竟比1000个智能体快了多少倍,也没有数据能够证明单体智能体究竟需要运行多少个月才能独立解决同一个问题。

更关键的一点是,Noam Brown坚决反对把解决千禧年数学难题的功劳全部归于多智能体。

多智能体架构在其中贡献的功劳甚至不到10%。

真正起决定性作用的,是OpenAI在底层训练出的那个极其强悍、具备超长视野推理能力的通用基础大模型。

多智能体只是把这种强大的底座能力在时间维度上进行了快速展开,底层模型的通用智能才是这场突破的绝对支柱。

过去几年里,AI行业在尝试构建多智能体系统时,普遍陷入了一种严重工程化的中心化死板支架思维。

常见的做法是人为设定一个总指挥协调器,下面挂载若干个子智能体。

协调器负责拆解任务、分发子任务,子智能体各自在封闭沙盒中计算,算完后再把结果交回给协调器。

这种中心化的人工架构在实际运行中暴露出极其致命的效率硬伤。

第一,如果两个子智能体分到了高度关联甚至互补的子任务,它们在既定架构下完全无法互相交流,形成了严重的信息孤岛。

任何一方遇到了对方可能早已解决的疑难点,都无法直接发问,极大地浪费了计算资源。

第二,如果子智能体对协调器下达的任务指令存在理解歧义,它面临着两难选择:要么中断执行去向协调器发起多轮低效的确认,要么完全基于自身主观假设硬着头皮做下去,导致最终产出偏离预期。

如果开发者为了解决这些痛点而在系统里不断堆砌特例逻辑,例如给特定节点之间增加连线,整个软件架构就会变得极其复杂、脆弱且难以维护。

OpenAI在这次万模系统中彻底抛弃了所有预设的复杂管理拓扑,走向了极致的极简主义。

研究团队没有给智能体强行灌输任何协调员、管理者或执行者的身份标签,也没有预设任何层级汇报路线。

他们只给每个智能体开放了最基础的原语工具:智能体拥有一个简单的通信工具调用权限,可以在需要时自主决定向任意其他智能体发送消息,收到消息的智能体会把内容动态插入自身的上下文窗口中。

仅此而已。

所有的协同规则、沟通时机与组织形式,全部交给模型自身在强化学习中自行探索与演化。

这种极度放权的策略在训练收敛后,涌现出了高度成熟且极其类似人类的协作形态。

在内部实验中,研究人员看到了令人惊叹的场景:

当一道极其复杂的题目下发后,智能体之间并没有发生混乱的广播拥堵。

某个智能体在局部推导后率先发信表示自己算出了答案;

紧接着另一个智能体立刻回复,指出自己的结果与对方不同,并询问对方推导第4步的核心依据是什么;

双方在通信通道中来回展开逻辑辩驳与假设核对,最终前一个智能体意识到自己的某一处边界条件考虑不周,随即向整个工作组广播,声明自己修正了之前的结论,认可了对方的证明方案。

整个沟通逻辑的平滑程度与组织效率,完全就像是一群顶尖的人类数学家在Slack群组里进行高效的异步办公。

在早期版本中,要让智能体自发学会沟通其实异常困难。

因为纯粹的强推理模型习惯于在单机环境下进行深度的线性思维链展开,来自外部其他智能体的消息插入,往往会直接打断模型本身的专注思考流,导致系统容易陷入所有智能体各自为战的局部最优陷阱。

但随着基础模型通用能力的全面提升,模型对自然语言交互的理解愈发敏锐,这种协作机制在经过强化学习的塑造后迅速成熟。

甚至在面对不同交互对象时,智能体能够清晰意识到自己当前是在与另一个AI对话还是在与一个人类对话,并自动切换出完全不同的交流节奏与语义密度。

在未来,这种多智能体系统的工作节奏将完全突破人类生理极限。

它们不仅不会疲倦和睡眠,且在超高速采样模式下的词元生成速度比人类正常语速快10到15倍。

在一个企业组织内部,这相当于存在一个以人类百倍速度狂飙运转的智能体蜂群,用短短一周时间彻底吞吐掉人类团队一整年才能消化的研发工作量。

数学能力在过去几年中的跨越式狂飙,直接为AI自动化研发与递归自我改进提供了最坚实的参照系。

回顾大模型攻克数学的历史轨迹,其加速度完全超出了所有顶级专家的预期:

2024年,AI还只能在中小学级别的基础数学题库GSM8K上答题,人类顶尖学者做这类题目只需要5秒钟;

随后模型攻克了MATH基准,对应人类专家需要思考1分钟的高中竞赛题;

紧接着模型拿下了AIME美国数学邀请赛的高分,这对应着顶尖竞赛选手需要连续演算10分钟的复杂难题;

到了2025年,模型在不借助外部计算器和互联网搜索的前提下,拿下了国际数学奥林匹克竞赛IMO的金牌,单题思考量达到人类专家的100分钟级别。

按照每年任务难度提升10倍思考时间的指数趋势推算,从IMO金牌跨越到需要顶尖数学家苦思冥想数年甚至数十年才能解决的千禧年大奖难题,理论上至少需要等到2028年甚至2030年之后。

但现实是,这个跨越在2026年就被万模系统以极其暴力的方式提前终结了。

就在该成果公布的两周前,某家顶级前沿实验室的核心研究员还曾与Noam Brown立下1000美元的赌注,坚信2027年之前绝对不可能有AI能够拿下任何一个千禧年大奖难题,甚至认为必须拖到2030年。

不仅外部学者预判失误,连OpenAI内部的核心团队也承认被这种突变速度彻底震惊。

尽管包括陶哲轩等学者在内的数学界指出,目前的模型虽然能够暴力证明那些定义明确的硬核难题,但在开创全新数学理论分支、提出深刻数学问题以及构建全新公理体系方面依然表现欠缺,展现出了明显的能力锯齿状特征。

但在机器学习研发领域,这种锯齿状的能力分布不仅不是缺陷,反而成为了推动递归自我改进的绝佳武器。

在AI算法研究中,科研人员根本不需要模型去玄学式地顿悟深奥的哲学理论。

机器学习工程的核心目标极其具象、明确且高度可量化:

如何在固定数据下降低预训练损失;

如何提升特定强化学习环境下的样本利用效率;

如何构建更稳健的在线学习架构。

这些目标全都有清晰的数字指标可以监控。

模型在数学证明中展现出的强大长程推导与逻辑闭环能力,可以直接无缝迁移到算法代码修改与训练超参数搜索上。

而且,AI在算法研发上的能力锯齿状具有一个根本性的正反馈特性:

即便模型自身在很多领域能力残缺,只要它在设计更强学习器这一个单一维度上展现出超强能力,它所迭代出来的下一个版本学习器,其通用泛化能力就会自动实现全方位的跃迁。

当然,AI自我迭代与纯数学推演之间存在一个物理屏障:实验算力与时延。

纯数学研究完全受限于大脑的思考带宽,只要算力给足、思维链拉长,逻辑就可以在真空里狂飙;

但AI研发必须进行真实世界的物理实验,训练一个新架构、验证一个新假设都需要消耗大量的GPU物理时间,实验结果必须串行等待。

这也是为什么AI目前不会在88小时内瞬间引发指数爆炸的奇点。

但算力底座的膨胀速度正在迅速抹平这一差距。

到明年年底,仅OpenAI一家实验室所拥有的庞大算力储备,就足以支撑成千上万个超人类智能体,让每一个智能体每天都能独立发起一次GPT-3级别的完整训练实验。

在OpenAI内部,顶级研究人员每天消耗在内部编程工具Codex上的费用已经达到7000到8000美元,内部研发流程的推进速度已经出现了3倍以上的实际加速。

如果以每年3倍的速度在指数曲线上奔跑,从非推理模型时代跨越到现在的全能智能体时代所经历的全部技术质变,未来将在短短一年内被彻底重演一遍。

目前,全球科技界与普通大众对AI能力的真实认知,与前沿实验室内部的真实技术现状之间,已经撕开了一条极其巨大的认知鸿沟。

公众目前所能接触到的商业化模型,虽然性能强大,但与实验室内部封存未发布的超前版本相比,已经存在显著的代际代差。

在数学领域,这种内外脱节的局面已经彻底成为现实。

内部未公开的模型不仅攻克了千禧年大奖难题,还在以惊人的速度连续吞噬和破解人类数学史上大量长期悬而未决的未解问题。

这种强大的认知能力在不久的将来会迅速外溢到算法优化、系统工程、经济决策甚至地缘博弈等各个关键领域。

一方面,为了确保安全,实验室理应放慢外部部署节奏,花费更长的时间去评估那些具备超长视野执行能力的高危模型;

但另一方面,外部发布节奏的放缓,不可避免地导致前沿实验室与外部真实社会之间的能力落差被无限拉大,造成极其危险的技术与权力高度垄断。

回顾从2011年Jane Street举办的第一场FOOM奇点辩论,到今天大模型在各个硬核科学领域全面屠榜,技术演进的烈度已经彻底超出了绝大多数人类学者的想象框架。

在访谈的最后,Noam Brown直言,过去那些长期在一线摸爬滚打的顶尖研究员,虽然对未来充满敬畏,但通常还敢于对未来12个月的技术走向做出大致靠谱的预测;

而到了今天,即便是身处技术风暴最核心处的OpenAI核心团队成员,也没有任何人敢于断言未来3个月后这个世界到底会演变成什么样。

用海量算力与智能体蜂群推动的自动化AI研发引擎已经点火启动,人类跨越奇点门槛的倒计时正在以周为单位疯狂缩短,留给全人类彻底解决对齐难题的时间窗口,正在不可逆转地急剧闭合。

作者:你说的完全正确(YAR师)

网址:OpenAI核心研究员坦白:上万Agent自发成军,奇点已经到来,三个月后无法预测 https://www.alqsh.com/news/view/406443

相关内容

Codex也断了:OpenAI三线齐崩,Agent时代的宕机账单怎么算
金灿烂用刨花种菜,三个月后喜获丰收
谢玉坦白赤焰军谋逆真相,琅琊榜关键一幕揭晓
人生就像天气,谁都无法预测未来
女人用不同男人体液受孕,三个月后亲手取出,只为起死回生!
必经之路已经到来
预测已经看了好几版了,而且大家都预测最佳女主
苹果一纸诉状撕破脸,OpenAI的″国内制造″却悄悄上马了!
OpenAI入局人形机器人赛道,目标未来人手一台机器人
OpenAI买下一档硅谷脱口秀,想要的不只是流量

随便看看