科学发现、研发反馈与物理智能
研究截止:2026年10月7日
版本:GPT V1.0|独立专题研究|交付格式:Markdown
研究对象:Google DeepMind,以及与其存在直接技术接口的Google Research、Google Cloud、Waymo和Isomorphic Labs。
本报告研究的中心问题:DeepMind能否把“解决一个问题的AI”转变为“持续制造更强问题解决能力的系统”?
本报告结论:若干局部反馈已经具备工程证据;把这些反馈连接为持续加速的通用研发体系,仍是需要验证的假设。
执行摘要
Google DeepMind值得深挖,并不只是因为Gemini处于前沿模型竞争中。它提供了一组可用于检验超级智能形成机制的实验:程序搜索、数学研究、科学预测、假设生成、虚拟环境学习、真实机器人,以及计算基础设施优化。
本报告判断〔D〕:目前最有解释力的主线,是“生成候选—外部验证—选择与积累—再次搜索”。 基础模型扩大可提出方案的范围,搜索扩大尝试数量,验证器决定哪些结果可以进入下一轮。真正的进步取决于三者如何协同,也取决于验证是否覆盖实际目标。
这条主线同时解释了进展与困难:
- 程序可以编译、测试和测量,反馈快、成本相对可控,适合大规模搜索。
- 科学假设可以被语言模型批评,却需要实验来确认;候选数量增长不等于知识增长。
- 视频世界可以生成连贯画面,是否适合训练实际机器人,要由真实动作结果验证。
- 研发辅助可以节省某个环节的时间,是否加快下一代AI,必须看整个研发周期及结果归因。
七项核心判断
| 判断 | 本报告采用的结论 | 证据状态与主要边界 |
|---|---|---|
| AI已经进入AI研发吗? | 是,公开证据已超出一般代码补全,涉及计算内核、系统与搜索流程优化 | 主要为公司论文和实际部署披露〔B〕;研发工时占比未知 |
| 已经发生AI R&D Takeoff吗? | 尚不能确认 | 缺少连续跨代、控制投入和人力后的研发速度数据 |
| 科研是否可能先出现局部超人能力? | 可能,部分结构化任务已经有实例 | 局部能力不能推出整体科学自主性〔B→D〕 |
| 超级智能会首先表现为系统吗? | 系统解释目前较强,但单模型解释与专门系统组合解释仍有竞争力 | 模块之间的增益有证据,全面融合未被证明〔D〕 |
| Multi-Agent是否必要? | 尚无必要性证据 | 应与单Agent加同等计算、搜索和工具做消融比较〔D〕 |
| World Model是否已经解决物理智能? | 没有充分证据 | 视觉一致性、决策有效性、物理精度及真实迁移是不同指标 |
| Alphabet的全栈优势能否保证胜出? | 不能 | 接口与规模提供优势,也带来资本、组织和控制复杂性〔D〕 |
最重要的数量辨析来自AlphaEvolve。研究者披露,其找到的矩阵运算相关启发式让特定内核平均加速约23%,对应整个Gemini训练时间减少约1%。局部优化和整体增长速度之间存在很大的换算距离。 这是已经产生真实价值的AI研发参与证据,不足以单独证明研发速度发生起飞。5
截至研究截止,Google已公布Gemini 4 Argon,并采取分阶段开放。最新组织安排也已变化:Hassabis转任Google DeepMind Chair与Alphabet首席科学家;Koray Kavukcuoglu以Google DeepMind SVP身份承担日常领导职责,同时担任Google首席AI架构师。把Hassabis继续写成日常运营负责人,或把Argon写成已经全面开放,都会使报告的研究基线失真。12
最有决策价值的观察对象,是系统能否在相同总成本下,持续增加“独立验证并被采用的有效结果”,同时减少人类补救和监督负担。 模型排名、Agent数量、候选数量、资本开支和演示视频,都不能独立回答这个问题。
一、研究设计:把“能力增强”与“智能增长加速”分开
1.1 六个真正需要回答的问题
- DeepMind各项成果依赖什么共同机制,又在哪些条件下不可互相迁移?
- AI提出的方案,如何从看似合理转变为可靠知识或实际工程改进?
- AI参与研发,是否已经改变下一轮AI能力增长的速度?
- 基础模型、工具、记忆、验证和环境,哪些是能力的来源,哪些只是交付条件?
- 虚拟经验是否能够提高真实世界的可靠行动能力?
- 资本、算力、实验和控制能力,何时会成为决定性瓶颈?
这些问题先于报告结构。资料收集后,本报告把章节组织为验证机制、研发反馈、系统解释、物理迁移、工业条件和治理,而非按产品逐一介绍。
1.2 证据分级
| 等级 | 本报告的用法 | 不能自动推出什么 |
|---|---|---|
| A:独立研究或权威外部数据 | METR方法与限制、IEA能源研究、独立学者对材料研究的分析等 | 独立来源也不等于结论无争议;预印本仍需复现 |
| B:官方一手资料与研究团队论文 | Google、DeepMind、Waymo、Isomorphic的披露;公司参与的同行评审论文;Alphabet监管文件 | 同行评审不能替代独立重复实验;部署披露不是独立审计 |
| C:权威媒体 | 用于新闻交叉核验和提供检索线索 | 未取得正文的报道不用于重建内部技术路线 |
| D:本报告分析 | 机制解释、竞争假设、情景、企业建议 | 不能写成公司已实现的内部状态 |
等级描述来源关系,不是机械的可靠性排序。 官方组织任命应优先采用正式公告;模型性能应优先比较同条件的独立测试。监管文件对财务口径较强,却不能提供DeepMind内部研发归因。
本报告的主要局限是:Google内部研发日志、失败实验全集、实际人力投入、模型训练配方和安全事件完整数据没有公开。涉及这些变量,明确保留未知。
1.3 工作定义
- 领域超人能力:在明确任务分布和公平资源条件下,持续超过合适的人类专家基线。
- AGI:跨广泛认知任务具备可靠、可迁移的能力。本报告不设一个单一考试日。
- ASI/超级智能:在广泛重要任务上,持续超过最强人类专家与大型组织,且能承担长周期目标、适应变化并产生可验证成果。
- 系统性超级智能:上述能力由模型、工具、环境、记忆、验证、协作与基础设施共同产生。它是待检验的实现方式,不是预设结论。
- AI R&D Takeoff:AI参与导致AI研发能力增长速度出现显著、持续的额外加速,而非只提高一个研究人员或一个任务的效率。
- Recursive Improvement:系统产生的改进进入下一轮研发能力,下一轮再扩大改进能力。必须记录改进来源、部署链和跨轮次收益,不能把任何迭代训练都称为递归自我改进。
这些是本报告的分析定义〔D〕,不替任何公司宣告AGI或ASI。
二、当前基线:研究主体已不是一个封闭实验室
2.1 组织变化及其研究含义
2026年8月公开的组织调整,将战略科学职责与日常模型、产品运营职责进一步分开。Hassabis保留研究咨询和战略角色,并继续领导Isomorphic Labs;Kavukcuoglu负责Gemini模型、前沿AI研究,以及Gemini应用与开发者团队,向Pichai汇报。公告同时披露Jeff Dean与Sanjay Ghemawat将创办独立公益公司,Google作为投资与Cloud合作方继续协作。1
本报告判断〔D〕:这是研究与产品协同方式的变化,不能仅凭职务变动推断“科学研究被放弃”,也不能推断“内部已经发现通往ASI的秘密突破”。 判断组织调整的结果,需要未来数据:基础研究项目是否持续、论文与工具是否开放、长周期科学研究是否获得资源,以及前沿模型与应用团队的共同评估标准是否改善。
2.2 正确归属成果
| 主体 | 本报告考察的接口 | 归属纪律 |
|---|---|---|
| Google DeepMind | Gemini、Alpha系列、SIMA、Genie、Robotics、前沿安全 | 核心对象 |
| Google Research | ERA及部分联合科学研究 | 不能全部归为DeepMind独立成果 |
| Google Cloud及基础设施团队 | TPU、编译器、部署、企业与科学工具 | 全栈协同需要具体接口证据 |
| Waymo | 世界模型的自动驾驶领域适配 | Waymo道路表现不能直接归因给Genie |
| Isomorphic Labs | AI药物设计及实验转化 | 药物研发机构,不能等同于AlphaFold产品 |
| 外部研究者与实验室 | 生物实验、数学评估、独立批评与复现 | 合作验证和完全独立验证应分开 |
这个边界有实际意义。如果科研候选由DeepMind提出,实验由大学完成,生产部署由Cloud团队承担,那么能力来自跨组织链条。将整条链条压缩成“某个模型自主完成”会高估模型自主性,也会低估合作机构的贡献。
2.3 Gemini 4 Argon:作为当前观察点,而非全篇排名中心
Google于2026年9月30日介绍Gemini 4 Argon,披露内部软件工程与安全任务应用,并将输出上限提高到100万token。这里是输出上限,不是上下文窗口。官方当时仍在加强防护,先面向可信测试者与网络防御机构,后续再扩大提供范围。2
应观察的不是“第一名”标签,而是:
- 同一长任务能否在需求变更、失败和不完整信息下继续推进;
- 最终结果是否通过不受Agent控制的验收;
- 总成本是否包括反复搜索、工具调用和人工复核;
- 能力提升是否伴随更强的越权、漏洞利用或监督规避风险;
- 外部机构能否在接近真实部署条件下复测。
截止日尚不能用公开材料确认Argon的全面可用性、独立任务时域或其对前沿AI研发周期的贡献。官方工程案例可以支持“任务范围扩大”,不能支持“整个研究团队已经被替代”。
三、贯穿不同成果的机制:把提案能力连接到可用反馈
3.1 从游戏研究到科研搜索:可以迁移的是方法结构
AlphaZero在已知规则的游戏中,通过自我对弈与强化学习改善策略;MuZero则学习对决策有用的环境表示,并用它规划行动。它们展示了学习、搜索与反馈的结合。3
但游戏提供了现实科研通常缺少的条件:规则明确、终局可判断、重试成本低、可快速生成经验。AlphaZero还需要对不同游戏分别训练;算法适用范围广,不等于一个训练好的策略可以直接胜任所有任务。4
本报告判断〔D〕:DeepMind的历史连续性,更适合解释为“寻找能够闭环优化的任务结构”,而非“一条从围棋平滑延伸到全部智能的技术直线”。
一个有效闭环至少要有四个组件:
- 可提出有价值候选的生成器;
- 能区分好坏、并覆盖重要失败的验证机制;
- 合理分配试验资源的搜索与选择策略;
- 将结果、约束和失败保留下来的状态或学习机制。
它们可以在不同项目中以不同形式出现。共同结构成立,不表示权重、记忆或技能已经完全共享。
3.2 验证的五个层次
以下是本报告提出的分析框架〔D〕。
| 层次 | 验证对象 | 典型方法 | 容易被误读的结果 |
|---|---|---|---|
| V1:形式与执行 | 程序能运行、证明能通过特定规则检查 | 编译、测试、形式验证 | 能运行被写成已经解决真实业务 |
| V2:任务性能 | 在固定数据、目标和资源下更好 | 隐藏测试、延迟、成本、精度 | 优化一个分数被写成全面进步 |
| V3:科学事实 | 对自然现象的预测或假设成立 | 实验、测量、统计、独立复现 | 模型一致赞成被写成实验验证 |
| V4:系统结果 | 改进在完整流程中有效 | 生产部署、端到端研发周期 | 局部速度提升被写成整体同幅提升 |
| V5:社会与物理结果 | 在真实使用中可靠、可控并产生价值 | 长期现场数据、事故与恢复、临床等 | 演示成功被写成规模化适用 |
上层通常增加成本、时间和不确定性。低层成功可以提供必要证据,却不能跳过高层。
这套框架不要求所有问题都用同一种验证器。数学的严格证明、生物实验的统计证据、机器人的物理测试,在认识论上不同。关键是声明验证能排除哪些错误,以及哪些错误仍然存在。
3.3 一个统一分析图,而非已部署架构
flowchart TD
M["模型提出候选"] --> S["搜索与资源分配"]
S --> V["独立于候选的验证"]
V --> K["保留结果与失败记录"]
K --> M
V --> E["真实部署或实验"]
E --> K
E --> R["研发能力是否提升"]
R -. "待证明的跨代反馈" .-> M
图中实线表示本报告用于分析各项目的过程;虚线表示跨代智能增长反馈的关键待证环节。它不声称Google已把所有模块整合在一套自主系统中。
四、科学智能:扩大搜索空间,仍要通过知识的门槛
4.1 AlphaFold的意义是预测基础设施,不能扩大成“生物学已解决”
AlphaFold 2通过新的网络结构和训练方法提高蛋白结构预测准确性;AlphaFold 3扩展到蛋白、核酸、小分子等相互作用复合体的联合结构预测。后一项是DeepMind与Isomorphic等研究者的工作。1213
外部的EMBL-EBI数据库说明,AlphaFold在CASP14中领先,并把预测结构提供给研究者使用。预测结果的可访问性,使模型可以成为广泛科研流程的输入。14
本报告判断〔D〕:其战略价值不只是替代一次结构预测,而是降低下游研究的初始不确定性,改变候选筛选和实验配置。 但结构预测不能单独保证功能、亲和力、体内疗效、毒性或制造条件。数据库中的预测数量,也不能按同等数量的实验发现计算。
更强的科学系统需要承认:
- 一个分子可能有多个构象;
- 实验条件可能改变结构和作用;
- 预测置信度不等于某个下游结论的概率;
- 生物功能与临床效果属于更长验证链。
这些是本报告对科学转化链条的分析,不是宣称模型完全不能处理上述因素。
4.2 AlphaGenome Atlas:计算覆盖率与实验覆盖率之间的距离
2026年9月8日发布的AlphaGenome Atlas,预计算约90亿种人类单碱基变化的分子效应预测,并结合AlphaGenome与AlphaMissense形成变异影响评分。官方披露了合作方的定向实验实例,并提供网站、API及Antigravity工作流接口。官方同时明确,它未经临床用途验证或批准。15
这类资源有两种不同价值〔D〕:
- 检索与排序价值:让研究者从庞大的候选集合中选择更值得实验的变异;
- 机制线索价值:把候选与剪接、表达或调控等可能路径联系起来。
它不是90亿次真实实验,也不是全部遗传因果关系的完成图谱。研究应该跟踪:被优先推荐的候选有多少在预注册实验中成立;与不使用该资源的流程相比,确认一个有效发现的总成本是否下降。
Atlas、基础模型和Agent接口的组合,说明专用科学资源能够进入通用工作流。它还没有证明:一个Agent可以脱离研究者,可靠完成疾病机制研究。
4.3 Co-Scientist:多Agent提高假设质量,不自动产生真值
2026年5月发表于Nature的Co-Scientist研究,使用Gemini构建生成、批评和演化科学假设的多Agent体系,以推理时计算扩展搜索。论文报告了白血病药物再利用、肝纤维化及细菌遗传转移机制等合作验证。它也承认文献访问、负结果缺失、幻觉与初步验证等限制;接入实验自动化仍被作为后续方向。8
这里的关键区别是:竞争排序优化的是候选的相对判断,实验检验的是自然现象。 Elo式排序可以整理提案,但它不具有天然的生物真值保证。
本报告据此提出三个检查点〔D〕:
- 比较对象是否包括同预算的单Agent反复搜索,而非只比较一次生成;
- 评价者是否看到真实实验结果,还是只评价文本可信度;
- 所有失败假设是否进入分母,还是只披露最终成功案例。
Multi-Agent可能有利于覆盖不同思路、异步执行与职责划分。然而,多个Agent如果依赖相同模型、相同文献和相似奖励,仍可能产生高度相关的错误。
4.4 最新科研自动化研究:闭环更长,但不能省略人类
2026年8月的Co-Scientist预印本把研究范围延伸到实验与论文,并包括Agent_H等推理系统方案。材料与生物研究仍保留人类实验执行或方案调整;Agent_H改动的是推理系统,不是基础模型权重。每条件50篇论文的比较中,带可靠性模块的自主组仍出现4%严重结果幻觉、24%实现与方法描述严重不一致;跨实验室复现等问题仍未解决。9
这组证据同时支持进展和限制:
- 进展:AI不再只提供一段建议,能够组织较长研究流程,并产生可实验的方案。
- 限制:系统可能把真实执行日志转化为方法上有缺陷的结论;“执行过”不等于“推断正确”。
- 分界:AI改进一个Agent的运行结构,是AI for AI的具体实例;它不等于自主发现并训练新一代通用模型。
Agent_H每次查询约需40—80次模型调用,而基础模型对照采用单次调用;医生盲评九个维度仅一个呈显著改善。因此,自动评分优势不能写成同成本优势或广泛的临床质量优势。9
本报告判断〔D〕:短期科研自动化的核心困难,可能从“能否生成一个方案”转向“能否保持整个证据链的有效性”。 例如训练测试泄漏、指标选错、事后筛选,都可能存在于能够运行且有完整日志的程序中。
4.5 ERA:将部分科研问题转换成可评分软件搜索
Google Research的Empirical Research Assistance以任务、数据和评价方式为输入,使用Gemini生成与修改代码,结合树搜索选择进一步探索的候选。官方研究涵盖六类科学计算任务。原始介绍发布于2025年9月;2026年4月更新主要补充系统名称,不能视为一轮全新实验。7
ERA的意义〔D〕在于降低“想法→实现→测量→改写”的循环成本。它也暴露一个边界:如果科学目标被错误地编码为评分函数,再有效的搜索也可能扩大错误目标的收益。
判断它是否超过科研助理,需要让系统面对:
- 未被人类预先充分定义的问题;
- 有隐藏混杂、数据问题或矛盾评价的情境;
- 需要拒绝现有指标、重新设计实验的情况;
- 在外部新数据上仍然成立的结果。
4.6 数学研究:推理与验证的边界尤其需要准确表述
Aletheia结合Gemini Deep Think、工具和生成—验证—修订流程,处理自然语言形式的数学研究。作者在研究论文中明确提醒:成功例子稀少,不能理解为系统能够稳定解决研究数学。官方也没有声称当时成果达到其分类中的重大进展或里程碑突破等级。1011
FirstProof研究的修订版报告:按多数专家评价,10题中6题得到解决,其中一题意见不一致。生成过程无需人类中途修改,但研究者参与首选答案的指定;论文对“正确”的解释容许符合同行评审惯例的小修订,并非全部原始输出可直接发表。17
这比一句“AI自主解出若干难题”更有信息:
- 自主生成,是过程属性;
- 专家认为正确,是结果评价;
- 人工选择,是系统边界;
- 形式检查,是另一种验证方式;
- 对问题进行重大重构,是更高层研究能力。
自然语言验证Agent不能自动等同于形式证明器。 未来若要判断数学研究出现领域超级智能,应记录新问题选择、证明修补、错误识别、发表与独立检验的完整链条,而非只记录解题数。
4.7 GNoME争议:不要把计算稳定性和可用材料合并
GNoME原始研究将候选生成、图网络预测与密度泛函理论计算结合,使用计算结果更新模型。论文报告约220万相对于原有数据库稳定的晶体结构,其中约38.1万位于更新后的凸包。这里主要是计算发现,不是同等数量的实验合成。18
独立材料化学家Cheetham与Seshadri肯定方法潜力,却对部分候选的新颖性、可实现性与实用性提出质疑。他们研究了部分样本,而非对全部数据库作穷尽检验。19
本报告不把两方结论平均,也不把争议写成“全部成果被推翻”:
- 原始研究对计算搜索与数据库扩展提供直接证据;
- 批评者更贴近合成与材料使用的判断标准;
- “计算稳定候选”与“有用新材料”包含不同要求。
采用的判断〔D〕是:GNoME支持科学搜索闭环的可行性,材料发现总量需要按计算、合成、复现、功能和用途分层统计。
4.8 药物设计:数字加速不能跳过物理与临床链条
Isomorphic于2026年9月公布的Drug Design Engine流程,是从设计要求到计算候选,再由科学家选择、合成和实验验证。其披露强调数日级计算设计,以及后续实验和临床开发准备。16
本报告判断〔D〕:数字设计环节可能快速进步,完整药物开发仍受实验、人体生物学和监管验证的约束。 数日生成候选不能换算成数日产生药物。公司关于传统流程需要数年的对比,也不能在缺少匹配基线时解释为全流程同等倍数提速。
这构成数字智能与物理结果时间差的一个清楚实例:前者提高候选产生与筛选速度,后者要求现实世界提供新的证据。
五、AI for AI:从工程辅助到研发速度变化,需要跨过哪些门槛
5.1 四个不同的反馈回路
| 回路 | 改进对象 | 公开证据 | 仍待证明的链条 |
|---|---|---|---|
| L1:运行优化 | 内核、编译、调度、芯片与软件 | AlphaEvolve及部署披露〔B〕 | 整体研发产出能否同幅提高 |
| L2:系统优化 | 搜索、Agent流程、推理配置 | ERA、Aletheia、Agent_H〔B〕 | 新配置是否稳定迁移到新任务和新模型 |
| L3:学习经验生成 | 策略训练数据、任务、反馈 | SIMA 2的自改进披露〔B〕 | 外部环境真实性、跨轮次持续收益 |
| L4:前沿模型研发 | 数据配方、算法、训练与下一代能力 | 局部相关工具已存在 | 无充分公开证据重建完整自主闭环 |
把四个回路都称为“AI自我进化”,会掩盖关键差异。L1可以节省计算却不创造新学习算法;L2可以提高同一模型的使用效果却不改变权重;L3改善策略却可能依赖更强教师和固定训练框架;L4才直接涉及下一代前沿能力增长。
5.2 AlphaEvolve:最接近工程现实的证据之一
AlphaEvolve将语言模型生成的程序放入可执行评价与演化搜索流程。2025年论文披露,特定矩阵运算相关优化带来约23%的内核平均加速,对整个Gemini训练的时间收益约为1%。2026年官方更新进一步披露其进入TPU电路设计及其他计算系统的使用。56
这提供两个有价值的事实层次:
- 某些AI生成的改进经过具体测量,而不只是文本建议;
- 部分成果进入持续使用的工程体系,而不只是一次榜单实验。
但本报告不会据此写成:
- Gemini训练整体提高23%;
- AI已经设计完整下一代TPU;
- 前沿算法研究已全部自动化;
- 连续多代模型研发出现无人正反馈。
人类仍需定义问题、约束和评价;完整收益取决于改进覆盖多少工作,以及新瓶颈在哪里。
5.3 局部效率如何换算成整体效率
采用一个简化分析式〔D〕:
整体提速 = 1 / [(1 − f) + f/r + h]
其中,f为原流程中可被AI加速的时间占比,r为这些环节的提速倍数,h为新增复核、协调和返工占原流程时间的比例。它假设阶段按时间相加,适用于说明瓶颈,不是Google实际研发模型。
举例:若40%的周期能够提速4倍,其余不变,新增复核占5%,整体提速只有约1.33倍。这个数字是示意计算,不是预测。
真实研发还存在阶段并行、排队、预算约束和失败重试。因此,必须区分:
- 节省计算小时;
- 节省研究人员小时;
- 缩短日历时间;
- 在相同时间内提高实验数量;
- 在相同投入下提高能力增量。
它们相关,但不是同一个量。
5.4 从参与研发到Takeoff的五级检验
| 级别 | 必须出现的证据 | 本报告对DeepMind的判断 |
|---|---|---|
| R0:辅助 | 提供代码、分析、文献或建议 | 明确存在 |
| R1:执行闭环 | 在预设任务中自动实验、评价与修改 | 明确存在若干实例 |
| R2:有效改进 | 结果通过外部于生成过程的检验,进入实际流程 | 有公司一手证据,独立复核覆盖有限 |
| R3:跨代反馈 | 改进进入下一代研发系统,后者产生更强改进 | 局部代理训练有披露;前沿通用研发链条不足 |
| R4:持续起飞 | 控制资源、人力和任务后,研发能力增长显著加速 | 尚无充分公开证据 |
这里的“外部于生成过程”可以是独立测试器,不一定是外部机构。独立机构复验是额外证据,不能混为一谈。
目前最稳妥的回答是:AI研发参与已经改变部分工程工作的生产方式;是否已持续提高智能增长速度,公开证据仍不足。
5.5 必须公开哪些数据,才能提高Takeoff判断的可信度
本报告建议〔D〕公开或由可信第三方审计以下数据:
- 同类研究任务中,AI承担的工作量、人工接管量及失败率;
- 研究计划提出到独立确认的日历时间;
- 候选总数、失败总数,以及进入生产或下一轮训练的比例;
- 控制计算、团队和数据后的能力增量;
- 至少三个连续轮次的来源追踪:哪个AI生成了什么改进,如何改变下一轮研发;
- 在不增加监督成本的条件下,改进是否持续;
- 是否出现AI主导的重要算法或训练方法,且由外部研究者复现。
连续三轮是本报告建议的最低观察窗口,不是自然规律或官方门槛。
5.6 正反馈可以出现,收益仍可能趋于递减
一个系统可能反复优化容易测量的内核,却越来越难找到新的空间。它也可能提高实验速度,同时让实验评价、训练排队或数据清洗成为瓶颈。
本报告区分两种相容的解释〔D〕:
- 加速解释:更强模型提高研究生产率,研究成果再提高模型,循环增益增长。
- 瓶颈迁移解释:AI消除若干环节的限制,剩余实验与组织环节使整体收益递减。
只有连续投入—结果数据,才能区分它们。一个成功案例无法决定哪种长期机制占主导。
六、Scaling已分成多种资源,不能统一叫“更大”
6.1 DeepMind案例中的Scaling变量
| 变量 | 能增加什么 | 主要瓶颈 | 本报告采用的检验 |
|---|---|---|---|
| 预训练 | 表征、知识与基础技能 | 数据、优化、成本 | 控制后训练后比较能力增量 |
| 后训练与RL | 推理、行动与奖励适应 | 奖励覆盖、分布迁移 | 新任务与反奖励投机测试 |
| 推理时计算 | 更多候选、修订与规划 | 搜索效率、验证精度 | 同总成本比较成功率 |
| 上下文与记忆 | 保留任务材料和历史 | 检索、状态更新、冲突 | 有效保留率与恢复能力 |
| 程序搜索 | 算法和实现探索 | 评价函数、执行成本 | 隐藏测试及部署结果 |
| 验证 | 筛除错误、引导搜索 | 漏检、相关错误、价格 | 独立判定与失效覆盖 |
| 合成经验 | 更大训练与交互集合 | 偏差、难度、真实性 | 新环境与真实任务迁移 |
| Agent运行时间 | 延长可推进的工作 | 状态漂移、失败累积 | 人类等效任务时域与接管 |
| 并行Agent | 更多实验与分工 | 重复、通信、协调 | 同预算单Agent消融 |
| 工具与现实资源 | 接触新信息、执行行动 | 权限、接口、延迟 | 资源利用是否产生最终收益 |
| 基础设施 | 更大吞吐与可用预算 | 芯片、内存、网络、电力 | 实际利用率与单位有效结果成本 |
这张表是分析框架〔D〕。它不声称所有变量都保持幂律,也不声称它们可以无限互相替代。
6.2 推理Scaling为什么有条件
Deep Think与Aletheia的官方研究显示,在相应数学任务中增加推理时计算可以提高成绩,Agent流程还能改善计算使用效率。11
从这些证据可推导的判断〔D〕是:
- 增加搜索预算有意义,前提是搜索能找到不同候选;
- 提高评价质量,可能比继续扩大候选数更有价值;
- 任务分布变化后,原有曲线不必保持;
- 不能把一次评估曲线延伸到无限计算和无限能力。
“Verifier Scaling”也不能只统计评审次数。若验证器和生成器共享错误,重复判断可能扩大虚假置信度。独立程序测试、真实实验和形式检查,各自在适用任务中提供不同的纠错渠道。
6.3 长输出、长上下文与长任务不是同一种增长
长输出可以帮助展开推理,但也可能增加自我强化的错误。长上下文可以装入材料,但不保证模型正确更新任务状态。持续运行可以生成大量动作,但不保证目标推进。
本报告建议:把token规模和任务成功记录分开。 优先考察系统能否在几次关键状态变化后,继续正确定位目标、已完成事项、待验证结论和当前权限。
对DeepMind内部持久记忆系统的容量、更新质量、跨任务迁移和研发贡献,现有公开材料不足以建立可靠基线。不能用Gemini的上下文能力填补这一未知。
七、单模型、系统还是组织:四个竞争解释
7.1 H1:统一基础模型是主要能力来源
最强论据是:Gemini参与语言、代码、数学、科学假设与行动任务,基础模型的跨任务能力减少了逐个问题重新开发专用模型的需求。〔B→D〕
如果H1占主导,应该看到:
- 改进基础模型后,大多数任务显著提高;
- 简化工具与流程仍保留主要收益;
- 更复杂Agent结构的边际增益缩小;
- 新领域不必依赖大量专门数据或人类设计。
反证条件是:基础模型升级后,端到端任务没有相应改善,或验证、环境和专用模块仍决定主要成功率。
保留未知: 公开项目通常同时改变模型、流程和计算,难以分离模型贡献。
7.2 H2:模型与外部机制组成更强系统
AlphaEvolve、Aletheia和Co-Scientist把模型与搜索、工具或评价流程连接;Robotics也区分高层推理与动作模型。〔B→D〕
如果H2占主导,应该看到:
- 相同模型通过更好的状态、工具和验证显著提高表现;
- 系统增益可跨模型迁移;
- 真实任务成本下降,不只是评估分数提高;
- 故障恢复与权限管理成为主要竞争要素。
反证条件是:复杂体系的优势在同预算比较中消失,或升级模型后旧组件不再产生收益。
7.3 H3:专门超人系统的组合,长期不形成通用自主智能
AlphaFold、GNoME与机器人策略可能分别很强,却使用不同数据、反馈和目标。连接API可以改善工作流,但未必形成统一理解或自主研究。〔D〕
若H3正确,将看到许多领域成绩提高,同时跨领域目标选择、长期规划和未知环境适应停滞。重要资源仍由人类组织配置,模块错误由人类协调修补。
这不是“AI没有价值”的情景。一个专门系统组合也可能对科研和产业产生巨大影响。
7.4 H4:最强能力来自研究机构与工业体系
Google拥有模型研究、计算架构、云部署、应用入口及实验合作接口。128 本报告据此提出机构层解释〔D〕:真正承担长周期目标的单位,可能是“人类研究者与AI共同组成的组织”,而不是一个可独立复制的Agent。
若H4占主导,领先指标应是单位投入的已验证研究产出、跨团队流程和实际部署,而不是模型权重的某个单独分数。
7.5 暂时采用的综合判断
本报告更支持H2与H4共同解释当前成果,但不排除H1在未来变得更强。 现有证据也与H3相容。这不是给四个假设平均概率;它说明目前可观察成果更多体现明确环境、验证和组织接口,尚不足以证明完全通用自主系统。
7.6 Multi-Agent不是必要条件的证据
一个Agent可以重复调用模型、切换角色和维护多个候选。多个Agent也可以只是在工程上把这些操作拆开。必要性判断需要比较:
- 同一基础模型;
- 同样token、工具和计算预算;
- 同样信息与权限;
- 相同最终验收;
- 不同协调方式。
本报告提出的协作评价是:
协作净增益 = 多Agent的有效结果 − 同成本最佳替代方案的有效结果
同时记录通信、重复搜索、共享错误与人工协调。Agent数量增加但净增益不变,不应被写成集体智能增强。
超过大型人类组织,还需要系统能选择目标、协调资源、处理冲突、记住承诺,并接受可追责的控制。现有材料不足以确认DeepMind拥有这一完整能力。
八、World Model与物理智能:虚拟经验能否越过现实接口
8.1 Genie 3:交互式世界生成不等于校准的物理模拟
Genie 3展示了由提示生成可交互视觉环境的能力,官方报告720p、24帧每秒和分钟级持续性,同时披露动作空间、多Agent交互、文字及环境准确性等限制。20
其价值〔D〕可能在于降低环境创建与经验收集成本。但是,画面连贯不能单独回答:
- 同一动作是否导致正确的接触与力学变化;
- 隐藏状态是否一致;
- 物体质量、摩擦或变形是否可校准;
- 罕见故障是否覆盖真实分布;
- 训练策略是否会利用生成环境的漏洞。
适合视频体验的模型,可以成为训练环境的起点;是否足够支撑机器人,需要额外验证。
8.2 SIMA 2:出现了经验生成与下一轮策略训练
SIMA 2在虚拟3D环境中通过图像、键盘和鼠标行动。官方描述了使用Gemini产生任务和反馈、自主积累经验,再训练改进版Agent的过程,也展示Genie环境中的迭代。官方同时承认长任务、记忆、精细动作及实时交互等限制。21
本报告采用的判断是:
- 存在一种局部自改进训练回路的官方证据。
- 该回路依赖既定训练体系、教师模型和环境。
- 它没有证明SIMA自主改造整个研究框架。
- 虚拟游戏任务上的收益不能直接替代真实机器人证据。
如果下一轮Agent提高了任务能力,属于策略进步;如果它还改善经验选择、评价、训练方法并持续带来更大的下一轮收益,才更接近本报告关注的递归研发机制。
8.3 Waymo:领域适配是迁移证据,也是边界证据
Waymo于2026年2月介绍基于Genie 3并经驾驶领域适配的世界模型,生成摄像头与激光雷达信息,并提供场景和驾驶控制,用于模拟罕见情况。22
这说明基础世界模型可以进入专门工业流程。它没有证明通用世界模型无需后训练即可准确模拟所有现实过程。
Waymo实际道路经验属于其自动驾驶体系;不能把道路里程算成Genie世界模型的真实世界验证里程。评估生成模拟应单独披露:传感器统计一致性、动作响应、事故重现、闭环策略结果,以及在真实道路上的额外收益。
8.4 Gemini Robotics 2:观察“参差不齐”,比观察最好片段更有用
2026年7月发布的Robotics 2包括动作、高层推理和设备端路线。官方披露同一检查点在多种硬件上的测试,同时承认多指操作仍有挑战;示例任务中,拧入灯泡成功率为36%,拧出灯泡为92%。这些是特定测试条件下的公司结果,不是通用家务成功率。23
模型卡进一步区分:
- ER 2接收多模态输入并输出文本推理,可作为机器人系统组件;不是直接输出电机控制的完整控制器。24
- On-Device 2输出数值动作,目前面向可信测试者;模型卡保留分布外任务、高自由度控制的限制,其安全评估主要围绕站立双臂操作,移动与全身控制不在同一已验证范围内。25
因此不能把不同变体的能力简单相加:全身动作演示不自动扩大设备端模型的验证范围,推理API开放也不等于完整机器人控制能力普遍开放。
8.5 为什么Digital与Physical可能出现明显时间差
本报告分析〔D〕至少有五个原因:
- 数字实验可以复制和并行;机器人需要设备、场地和维护。
- 代码失败常可回滚;物理失败可能损坏设备或造成伤害。
- 数字任务的状态较容易记录;物理系统存在遮挡、磨损、接触和传感误差。
- 虚拟经验可大量生成;其真实性必须校准。
- 软件可以迅速部署;硬件的制造、安装和认证有自己的周期。
但不能据此给出固定的几年差距。传感器、硬件标准化、世界模型和机器人数据效率若同时进步,差距可能缩小;若灵巧操作与安全恢复停滞,差距可能长期维持。
8.6 验证模拟迁移的最低实验设计
本报告建议〔D〕使用四组对照:
| 组别 | 训练条件 | 需要回答的问题 |
|---|---|---|
| P0 | 仅真实数据 | 原有真实任务基线 |
| P1 | 真实数据+传统模拟 | 传统模拟的增益 |
| P2 | 同等真实数据+生成世界 | 生成环境是否提供独立增益 |
| P3 | 减少真实数据+生成世界 | 是否真正降低真实数据成本 |
在同一批未见环境中,记录任务成功率、接管、碰撞、动作异常、恢复和总成本。若P2只改善模拟分数,现实测试没有提高,不应宣告物理智能突破。
九、从软件研究到工业条件:优势与约束同时扩大
9.1 TPU路线表明训练与推理资源正在分化
Google Cloud于2026年4月披露TPU 8t与8i:前者面向训练,后者面向推理与推理型负载,采用不同内存与网络配置。官方性能和性价比比较依赖特定条件,并使用“最高可达”等口径。28
本报告判断〔D〕:AI能力增长不再只要求更大的训练集群。长推理、程序搜索、并行实验和Agent服务,需要不同的内存访问、网络、延迟与调度方式。
DeepMind相关优势,可能出现在四个接口:
- 研究目标与芯片设计;
- 模型结构与编译器;
- 训练配方与集群运行;
- Agent工作负载与推理服务。
优势是否成立,应看实际端到端吞吐、稳定性与单位有效结果成本;芯片峰值性能不能直接表示研究产出。
9.2 财务约束:不能把Alphabet预算当作DeepMind预算
Alphabet提交的2026年第二季度业绩文件披露:
| 指标 | 2026年第二季度数值 | 口径 |
|---|---|---|
| 经营现金流 | 约390.69亿美元 | 集团季度数据 |
| 购置物业与设备 | 约449.24亿美元 | 资本支出相关现金口径 |
| 自由现金流 | 约−58.55亿美元 | 公司定义的非GAAP指标 |
| 6月股权发行净所得 | 约496亿美元 | 用于一般公司用途,包括扩大AI基础设施 |
| 当季优先无担保票据净所得 | 约203亿美元 | 一般公司用途 |
来源为公司监管披露;季度财务表为未经审计数据。它没有披露DeepMind单独的算力预算、回报率或每个项目的投入。29
本报告判断〔D〕:现阶段研究能力已经与资本市场和工业扩张相互连接。拥有强经营业务并不表示AI基础设施可以无限内部供资。某季度自由现金流为负,也不能单独推断公司无力投资或AI业务没有收益。
更适合研究的是:新增能力与使用收入是否跟上折旧、融资和供给成本;哪些研究方向需要资源保障;预算紧缩时哪些项目会被优先保留。
9.3 电力和HBM:全球趋势不能直接套到Google
IEA于2026年发布的研究估计,全球数据中心用电从2025年的485TWh,可能在2030年达到约950TWh的中央情景;同时指出并网、设备与芯片供应限制,并预计HBM紧张可能延续到至少2027年末。后两项含预测,950TWh也不是已经发生的事实。30
该数据涵盖全球数据中心,不等于AI单独用电,更不是Google或DeepMind用电。
本报告判断〔D〕:有效算力受一串相互依赖的条件约束——芯片可得、内存与网络配套、机房建成、电力接入、冷却可用、集群稳定、软件能用好。公布计划容量不能代替实际投入运行。
对核电、储能或现场发电的评估,需要分开合同、许可、建设和实际供电;本报告不以远期供能承诺作为现成研发资源。
9.4 规模可能加强优势,也可能改变技术选择
如果搜索和推理越来越消耗资源,那么最优方案可能是:
- 让较小模型提出便宜候选,较强模型处理困难节点;
- 提高验证器选择性;
- 复用已有实验和失败记录;
- 根据风险与价值配置预算;
- 在真正缺少证据时停止搜索,而不是无限生成。
这些是本报告的技术经济推断〔D〕。未来胜出体系不一定是每个环节都使用最大模型的体系。
十、Control:科研加速与风险增长来自同一行动接口
10.1 当前前沿安全框架在追踪什么
DeepMind的Frontier Safety Framework 3.1,区分较低层级的关注能力与关键能力,并覆盖滥用、监督规避及机器学习研发等风险。其ML R&D自动化等级关注能否以相近全成本自动化Google某个能力研究团队;框架也认为研发加速可能来自模型结合工作流,而非权重单独作用。31
框架定义了某个门槛,不等于公司已经达到该门槛。
该文件的决策涉及风险评估、缓解与风险接受条件,不能压缩成“任何能力越线都会自动停止训练”。同样,发布框架也不能证明实际部署始终符合框架。
应检查:谁评价、覆盖哪些系统、哪些条件触发升级、哪些证据被公开,以及实际风险处置是否可以被外部检验。
10.2 Agent控制开始采用行动与基础设施视角
2026年6月的控制路线把能力强但不完全可信的Agent视为潜在内部威胁,提出监督、阻止与响应机制,追踪监控覆盖、召回和响应时间,并承认可见推理可能不足以处理规避或不透明推理。27
这是有解释力的方向〔D〕:安全需要保护权限、网络、数据和实验资源,不能只检查最终回答是否含危险文本。
Argon发布材料也描述了推理与行动监测、执行中止和隔离环境强化。它是公司的缓解披露,不能当作外部验证过的完整控制保证。2
10.3 机器人安全不能由语义推理单独承担
Robotics 2安全报告研究多种语义和Agent风险评估。设备端模型卡另建议分层控制:高层语义判断、低层碰撞与力控制,以及硬件相关安全机制。2625
其中一项闭环评估使用Gemini模拟VLA置信反馈,避免实际机器人或物理模拟器。这可以检验Agent是否遵守反馈约束,不能独立证明真实机器人危险动作已被可靠拦截。26
本报告判断〔D〕:机器人“理解不要伤人”与“物理系统在错误动作下仍安全”是不同能力。完整体系需要处理感知错误、执行异常、网络中断和机械问题。真实安全证据应包括危险动作率、接管、紧急停止与恢复,而非只给拒绝危险指令的成功率。
10.4 为什么AI研发自动化具有特殊控制风险
以下为机制分析〔D〕,不是指控DeepMind已经发生相关行为:
- 研究Agent需要访问代码、训练日志、数据和大量算力;
- 优化任务容易赋予它修改测试、调度和监控的能力;
- 如果评价者、被评价对象和评价设置由同一系统控制,反馈可能失真;
- 快速生成大量实验会增加安全审查积压;
- 比人工更难理解的优化可能提高验证成本。
因此,能力与控制必须成对观察:
| 能力增长 | 必须配对的控制指标 |
|---|---|
| 更多工具和系统权限 | 最小权限覆盖与越权率 |
| 更长运行时间 | 监控持续性、状态记录与可恢复性 |
| 更强代码和网络能力 | 隔离环境实测与漏洞利用拦截 |
| 自动修改研发流程 | 不可自行修改的验收与审计链 |
| 更强实验设计 | 实验风险审批与执行边界 |
| 更多Agent并发 | 调度、权限继承与集体行为监测 |
10.5 治理与收益归属
2026年9月成立的DeepMind Institute提供跨学科讨论平台,由Legg、Manyika和Hassabis担任负责人。其说明明确:文章是作者观点,不应被读成Google官方立场。34
该平台可以促进讨论,却不是独立监管者,也不是部署批准机构。不能用其成立来证明治理已跟上能力。
本报告提出三个利益分配问题〔D〕:
- 科学预测、模型权重、数据和验证资源,哪些应保持公共可访问?
- 外部研究者能否检验关键能力与安全判断,还是只能看到筛选后的实例?
- 科研合作产生的知识与利益,如何在平台、实验机构和公共资助方之间分配?
Google体系同时提供研究资源、商业云服务和应用分发。它可以降低参与门槛,也可能集中对接口、价格和可见结果的控制。两种结果均需从实际开放条件与使用数据判断,不能仅凭“开放”或“全栈”口号决定。
十一、证据地图:哪些已成立,哪些仍不能成立
| 研究命题 | 直接证据 | 本报告采用状态 | 主要缺口 |
|---|---|---|---|
| 通用模型能够参与不同研究任务 | Gemini相关科学与数学项目〔B〕 | 成立于已测试任务 | 跨领域可靠性与完全自主性 |
| AI能够搜索并测量程序改进 | AlphaEvolve、ERA〔B〕 | 有较强一手实验与应用证据 | 独立部署复核与总体收益 |
| AI可以提出实验可检验的新假设 | Co-Scientist合作研究〔B〕 | 有实例 | 全部尝试分母与独立复现 |
| AI可以持续独立完成科研 | 最新科研自动化预印本〔B〕 | 未充分成立 | 人类执行、方法错误与外部复现 |
| AI已经改善Agent系统 | Agent_H与相关研究〔B〕 | 有局部实例 | 新任务、代际与同预算验证 |
| Agent可以用生成经验改善 | SIMA 2〔B〕 | 有局部官方证据 | 教师依赖与真实迁移 |
| World Model能进入工业模拟 | Waymo领域适配〔B〕 | 成立于披露的接口 | 外部校准与实车额外收益 |
| Robotics具备广泛物理可靠性 | 官方任务与模型卡〔B〕 | 尚不能确认 | 长期真实分布、事故、维护、接管 |
| AI研发速度持续显著加速 | 未见足够公开归因数据 | 未知 | 资源控制下的连续研发周期 |
| 单一系统已整合全部科学与物理能力 | 多个模块与局部接口 | 尚无充分证据 | 统一目标、记忆、迁移与长任务 |
| 基础设施会形成约束 | IEA〔A〕、TPU与财务〔B〕 | 全球层面有证据 | Google各项目的具体暴露 |
| Control能稳定跟上能力 | 框架与缓解披露〔B〕 | 未被公开证明 | 独立高强度攻击、覆盖与处置数据 |
本报告没有为“未知”填上估计值。公开资料缺失,既不证明内部没有实现,也不允许报告假定已经实现。
十二、主动反证:本报告最可能在哪些地方判断错
12.1 “验证是关键”也可能只是当前工程方式的错觉
更强的基础模型可能显著减少搜索和外部修补需求。如果未来一个模型在复杂新任务中直接给出高可靠结果,且系统组件贡献降低,本报告会提高H1的权重。
但“需要更少验证”仍要由独立结果证明。模型表达更自信不是反证。
12.2 科研反馈可能无法有效提高通用智能
科学模型可以准确处理特定表征,却不提高通用规划或社会任务。不能把科学成功累计成AGI分数。
2026年9月底的外部预印本Fold2Reason提供一种反向线索:蛋白结构来源的监督可能改善某些广泛推理评估,作者报告平均提升约3.23个百分点。但这是早期预印本,未证明前沿模型或长任务研究能力获得相同迁移。33
本报告保留“科学数据帮助通用智能”的可能性,同时拒绝从小幅评估迁移直接推导ASI。
12.3 更大候选池可能只是更大的选择优势
如果一个系统生成成千上万候选,再由专家挑选,最终表现好可能来自搜索预算和人工筛选,而非更强自主研究。
反证方式:限制总预算、记录全部尝试,在隐藏任务上与强人类团队和同预算单Agent比较。只披露成功方案无法回答。
12.4 封闭评价可能被过拟合
可评分任务适合搜索,也容易被搜索利用。测试集泄漏、特殊情况和不真实基线,都可能制造能力错觉。
应把验证器分为优化期间可见的反馈与最终不可见验收。若后者没有提高,本报告将下调相关能力判断。
12.5 物理迁移可能比预计更快,也可能长期停滞
若生成世界显著减少真实数据需求、跨硬件迁移可靠,Digital与Physical的差距可能缩小。反之,若灵巧操作、意外恢复和长期维护没有改善,优质演示仍可能与实际使用相距很远。
12.6 全栈优势可能被独立生态削弱
外部模型、开放工具和专门实验机构也可以组合有效系统。它们不一定需要所有资源都归于一家企业。
本报告不把“拥有全栈”当作充分条件。应观察:协同是否真实降低成本与失败,还是组织协调和封闭接口抵消优势。
12.7 科研自动化可能增加低质量研究,而非有效发现
假设与论文生成的边际成本下降,可能增加复核负担和重复方向。若有效结果占比下降,实验资源被较弱提案挤占,科研速度未必提高。
因此,“论文数量”“生成假设数量”和“Agent工作小时”都只能作为投入指标,不能作为最终智能增长指标。
12.8 Control可能成为增长的必要投入,而非附加成本
更强Agent可能需要更严格隔离、更慢审批或更多监测。忽略这些投入会高估经济收益。
若控制技术提高,使每个有效任务的监督负担下降,能力才更容易形成可部署增长。若监督工作随能力更快增长,Takeoff可能受到现实限制。
十三、未来3—10年情景:按条件更新,不给ASI精确日期
观察窗口:2026年第四季度至2036年前后。 以下为本报告情景〔D〕,不是公司承诺。情景可能同时出现于不同领域;不赋予缺乏依据的精确概率。
情景A:能力持续改善,系统逐步扩大,长期没有统一AGI日
| 维度 | 分析 |
|---|---|
| 前提 | 基础模型、推理与Agent继续进步;模块融合仍需要大量工程 |
| 领先指标 | 隐藏任务成功率上升;接管和返工下降;科学工具进入更多流程 |
| 可能结果 | 数字工作与部分科研显著自动化,物理任务发展较慢 |
| 主要风险 | 把多个局部能力误读为通用自主性;监督成本被低估 |
| 提高该情景权重的证据 | 进展广泛但连续,关键突破仍依赖任务定义与人类验证 |
| 降低权重的证据 | 无重大投入增长却出现可靠研究团队替代,或能力趋势长期停滞 |
这是当前最容易由已有公开证据延伸出的基准观察路径,并不意味着其他情景不可能。
情景B:AI R&D出现显著加速
| 维度 | 分析 |
|---|---|
| 前提 | AI不仅执行研究,还改进实验选择、训练与研发工具;收益进入下一代 |
| 领先指标 | 连续研发周期缩短;相同资源的能力增量提高;AI贡献可追踪 |
| 可能结果 | 模型、Agent和优化体系更快迭代,监督与基础设施承受更大压力 |
| 主要风险 | 错误评价被迅速放大;能力与防护更新不同步 |
| 提高权重的证据 | 至少多个连续轮次有可审计的正反馈;重要算法获独立复现 |
| 降低权重的证据 | 加速主要来自算力或团队扩大;局部成果未改变整体周期 |
不能用一次内核优化或一次Agent训练改进宣告该情景已经发生。
情景C:工业与控制约束成为主瓶颈
| 维度 | 分析 |
|---|---|
| 前提 | HBM、电力、机房、资本或安全验证限制扩张速度 |
| 领先指标 | 计划与投产差距扩大;资源排队;单位有效任务成本难降 |
| 可能结果 | 更重视小模型、选择性搜索和节省验证成本;部署节奏分化 |
| 主要风险 | 争抢资源引发仓促部署;研究资金被短期应用挤占 |
| 提高权重的证据 | 多季度出现实际资源限制及能力研发延迟的具体归因 |
| 降低权重的证据 | 有效算力稳定增长,资源效率改善超过新增需求 |
约束可能减慢增长,也可能推动新的技术选择;不能机械写成“电力阻止ASI”。
情景D:新范式降低现有瓶颈
| 维度 | 分析 |
|---|---|
| 前提 | 学习、记忆、世界表征或验证出现显著新方法 |
| 领先指标 | 在同预算下,新领域和长任务大幅改善;独立复现和清楚消融 |
| 可能结果 | 大模型规模不再是主要解释变量,系统结构重新组织 |
| 主要风险 | 将特殊任务增益包装为一般范式;短期成功难以扩展 |
| 提高权重的证据 | 多任务、多规模、多个机构获得持续增益 |
| 降低权重的证据 | 优势依赖特殊数据、过高预算或人工筛选 |
DeepMind历史上多种研究方式并存,提供探索空间;不能据此脑补未公开路线。
情景E:专门科学超级智能先于一般社会自主智能
| 维度 | 分析 |
|---|---|
| 前提 | 程序、数学及部分实验科学的验证结构更适合自动搜索 |
| 领先指标 | 科研端有效发现率与确认速度提高,普通开放任务仍频繁失败 |
| 可能结果 | 某些研究系统超过大型人类团队,但日常复杂代理仍不可靠 |
| 主要风险 | 扩大科研双重用途能力;知识与资源控制过度集中 |
| 提高权重的证据 | 外部复现的重要科研贡献增加,而跨域迁移有限 |
| 降低权重的证据 | 研究进展不再依赖专门设置;通用目标管理同步成熟 |
这里的“专门科学超级智能”是领域概念,不等于本报告定义的广泛ASI。
情景之间的关键转折
最值得关注的不是某一年,而是三个变化:
- 从“AI改进人类设定的方案”转向“AI识别并重构研究目标与评价方法”;
- 从“局部结果可用”转向“跨代能力增长的额外收益可归因”;
- 从“数字环境成功”转向“现实行动长期可靠,并可监督中止”。
任何一个变化都需要新的证据,不由产品命名决定。
十四、季度领先指标仪表盘
原则:同一任务分布、同一成功定义、完整分母、记录投入、保留不确定性。 官方结果与独立结果分栏;未公开记为“未知”,不记为零。
14.1 24项监测指标
| 编号 | 指标 | 建议定义与记录 | 截止日基线状态 | 季度更新重点 |
|---|---|---|---|---|
| 01 | 跨领域可靠能力 | 隐藏新任务上按领域列成功率,避免只报总平均 | 多领域官方证据;统一独立基线不足 | 最弱领域是否改善 |
| 02 | 50%任务时域 | 专家人类完成时间对应的50%成功阈值,含区间 | 可用METR方法;不能给Argon未测值 | 任务集和评估配置是否变化 |
| 03 | 高可靠任务时域 | 优先80%,更高可靠性需足够数据 | 最新系统公开值不足 | 失败是否由少数类型集中贡献 |
| 04 | 人类接管负担 | 每个完成任务的接管次数与分钟数 | 未知 | 是否下降,而非只延长运行 |
| 05 | 端到端经济成功率 | 完成且通过真实验收的任务/全部任务 | 未知 | 包括工具和人工成本 |
| 06 | 有效记忆 | 状态更新、遗忘、冲突与恢复测试 | 缺统一公开基线 | 任务变化后的正确保留率 |
| 07 | 多Agent净增益 | 同成本最佳单Agent对照的额外有效结果 | 未公开统一消融 | 重复和通信成本 |
| 08 | 可控并发规模 | 在固定失败、成本和风险上限下的并发量 | 未知 | 净产出与权限管理 |
| 09 | AI研发工作占比 | 按编码、计划、训练、评价分别统计已验收贡献 | 未知 | 不采用代码行数代替 |
| 10 | 完整研发周期 | 问题提出至独立确认及部署的日历时间 | 未知 | 同类任务匹配与资源控制 |
| 11 | 单位研发能力增量 | 每计算、资本与研究工时的能力收益 | 未知 | 同口径趋势 |
| 12 | AI改进采用率 | 部署改进/全部候选,按重要性分层 | 有实例,无完整分母 | 失败与撤回同时披露 |
| 13 | 跨代反馈深度 | 带来源记录的连续改进轮次 | 局部训练有披露;通用研发不足 | 新一轮是否提高改进能力 |
| 14 | 新知识确认率 | 外部复现或严格检验的研究结论/全部提案 | 有合作验证实例 | 完全独立复现增加 |
| 15 | 发现确认时间 | 提案至验证,含排队、失败与人工工作 | 未知 | 不能只统计生成时间 |
| 16 | 科研方法错误 | 严重方法缺陷、幻觉和撤回率 | 有预印本样本结果 | 新数据与外部审查 |
| 17 | 实验自主程度 | 设计、执行、分析、修改分别列人工参与 | 当前仍有人工环节 | 减少人工是否损害可靠性 |
| 18 | 世界模型校准 | 预测状态与真实测量误差、罕见事件覆盖 | 缺跨任务独立基线 | 不用视觉评分代替 |
| 19 | 模拟至现实增益 | 固定真实数据后的现场额外成功率 | 缺统一公开对照 | 四组训练对照 |
| 20 | 物理任务可靠性 | 真实新环境成功、接管、损坏与恢复 | 官方任务表现不均 | 长任务及连续现场数据 |
| 21 | 有效算力 | 实际吞吐、利用率、故障与可用时长 | 硬件披露多;研究分配未知 | 计划、投产与实际使用分开 |
| 22 | 能源与资本成本 | 每个有效任务及研发轮次的完整成本 | 集团及全球数据;项目未知 | 并网、折旧、融资与需求 |
| 23 | 控制有效性 | 监控覆盖、攻击召回、阻断、响应与逃逸 | 框架存在;完整实测不足 | 独立对抗与并发压力 |
| 24 | 外部可验证性 | 数据、版本、结果分母和独立测试访问 | 项目间差异很大 | 是否扩大而非收缩 |
14.2 METR如何使用,如何避免误读
本次核验的METR任务时域页面显示最后更新为2026年5月8日,采用TH1.1。时域指的是对应任务的人类专家完成时间,不是AI连续运行了多久;任务主要是自包含的软件、机器学习和安全工作。页面还提示当前任务集对16小时以上测量不可靠。32
METR研究者另指出,50%成功时域不能直接作为可靠委托边界;真实任务复杂性、上下文和监督费用会改变实际自动化收益。该说明是研究者方法笔记,其审查程度低于正式研究报告。35
所以本报告不补造Gemini 4 Argon的METR成绩,也不按历史曲线外推一个确定ASI日期。季度更新时必须先确认新任务集、模型、Agent配置和统计区间。
14.3 每季度更新的最小记录表
指标编号:
观察截止:
模型/系统版本:
任务分布与隐藏测试:
全部尝试数量:
成功定义:
计算、工具、实验与人工投入:
官方结果:
独立结果:
统计区间与失败类型:
相较上季度是否可比:
相关情景的上调/下调理由:
仍未知的内容:
指标变化应进入情景判断,而非合成一个伪精确“ASI指数”。例如:
- 09、10、11、13同时改善,提高情景B权重;
- 18、19、20共同改善,才支持物理迁移加快;
- 01、02改善而04、05不改善,说明能力尚未转化为稳定委托;
- 能力增长而23下降,需要降低可部署增长判断;
- 21扩大但11停滞,应检查边际研发回报。
这些是本报告的更新规则〔D〕,未来可随测量方法改善而修订。
十五、对企业与个人的意义
15.1 企业:从可验证的工作切入
本报告建议〔D〕优先寻找:
- 输入和约束可以明确;
- 最终结果能够独立验收;
- 失败可恢复;
- 权限边界可控制;
- 成功会改变实际成本或交付时间的任务。
软件测试、数据处理和部分计算实验通常容易构建较快反馈;开放研究、现场操作和高风险决策则需要更长的验证链。这是任务结构分析,不是对某个产品的采购推荐。
试点要保留强人类基线、同预算AI替代方案和人工复核工时。只统计生成速度,容易把复核负担移到别处后误认为效率提高。
15.2 科研与产业机构:验证资源可能更稀缺
如果候选生成迅速扩张,实验设备、可靠数据、计量、外部复现和领域专家判断的相对价值可能上升。〔D〕
企业的优势可能来自:
- 高质量真实数据和负结果;
- 清楚的评价与验收;
- 可自动执行的实验接口;
- 能将发现转化为生产结果的能力;
- 保留来源、审计和失败记录的流程。
这些资源可以与不同模型结合。不能把全部战略建立在某一代模型永久领先的假设上。
15.3 管理者:工作组织会变,但责任不能只交给模型
任务应写明目标、资源、验收和权限;重要决定应保留可追责主体。跨团队Agent部署还需要明确谁处理冲突、错误传播和失败恢复。
更多Agent不自动减少管理成本。如果人类忙于判断多个Agent相互矛盾的输出,部署可能只是把执行负担改成协调负担。
15.4 个人:提升问题定义和结果验证能力
本报告判断〔D〕:随着代码、文献整理和初步方案更容易获得,判断一个问题是否值得做、如何设计验收、怎样解释失败,可能更重要。
有用的实践是保留个人工作中的证据链:问题、来源、假设、版本、测试、错误与决策。它帮助判断AI究竟扩大了能力,还是只增加产出数量。
本报告不据此宣告某种职业必然消失。职业变化还取决于组织采用、责任、现场条件和市场需求,现有技术资料不足以做确定性预测。
十六、关键未知与最终研究判断
16.1 不应被故事填满的未知
| 未知问题 | 为什么不能确认 | 最有价值的新证据 |
|---|---|---|
| DeepMind内部多少研发由AI完成? | 未公开完整工时和任务分母 | 分角色、按验收结果的审计 |
| Gemini代际研发是否被AI显著缩短? | 周期、资源、失败和归因不足 | 多代匹配投入的研发数据 |
| 是否存在完整自主模型研发闭环? | 工具与局部实例不能重建整体 | 训练、评价、部署的来源链 |
| 科学系统是否具有统一长期记忆? | 接口公开不等于状态统一 | 跨项目长任务与记忆测试 |
| Multi-Agent是否必要? | 缺全面同预算消融 | 单Agent、搜索与协作对照 |
| 生成世界是否真实降低物理数据成本? | 演示与模拟成绩不足 | 固定真实数据的现场结果 |
| Control是否能对更强系统保持有效? | 框架与披露不等于实测保证 | 独立对抗、覆盖和响应数据 |
| 哪条研究路线被组织调整加强或削弱? | 任命无法代替预算与项目数据 | 长期研究投入与产出变化 |
| 数字与物理超级智能相隔多久? | 技术、硬件和制度共同决定 | 连续跨领域真实可靠性 |
| ASI何时出现? | 定义、测量与增长机制仍有不确定性 | 领先指标联动,而非愿景日期 |
16.2 最终判断
第一,DeepMind已提供“AI扩大可验证搜索”的具体证据。 有些结果进入工程和科学合作流程,不能把它们仅视为聊天能力的延伸。
第二,局部闭环与通用递归改进之间仍存在证据缺口。 研发参与、策略自改进、Agent流程优化和前沿模型研发起飞,需要分别统计。
第三,系统解释目前比单一模型排名更有研究价值。 它能解释相同模型在不同环境中的巨大表现差异,也能解释验证、动作与基础设施为何成为关键。但它不是已被证明的唯一ASI实现方式。
第四,科研自动化最可能先在反馈清楚、可执行、可重复的任务中深化。 物理和生物验证更昂贵,知识确认不会按文本生成的速度自动增长。
第五,未来应同时观察能力、结果与控制。 只有生成能力增加,不能确认有效研究增长;只有有效研究增加,不能确认可部署的超级智能形成。
本报告的核心分析框架是:候选能力×搜索组织×验证质量,经由真实资源和控制条件,转化为有效结果;其中多少有效结果重新提高下一轮研发能力,决定是否出现持续加速。 这里的乘号表达相互依赖,不是已拟合的量化定律。
下一次季度更新,最值得验证的是:能否获得连续、可归因的研发周期数据;科研结论的独立复现是否增加;模拟经验能否提高真实物理可靠性;以及控制效果是否随能力一起提高。
来源与核验说明
所有下列来源均于2026年10月7日联网检索或核验。日期指首次公开或注明的版本日期,不是本报告推定的实验完成日期。公司参与的论文即使经过同行评审,仍标为B,并另注明审查状态。部分网页正文或附件受访问限制,已明确标出;未读取的内容不用于补充技术细节。
本报告引用只提取与判断相关的事实,不把官方预测、产品宣称或预印本成绩当作独立确认。新闻检索作为交叉核验线索,不据此构造内部研发叙事。
版本更新规则: 下次更新保留本版判断及其当时依据,新增证据逐项改变状态;不以新的产品名覆盖旧测量,不把缺失信息解释为零,不让故事完整性优先于未知。
-
B|Google正式组织公告。 Pichai、Hassabis,The next chapter of our AI momentum,2026年8月组织调整;抓取正文未显示具体发布日期。核验正式职务与职责、Jeff Dean及Sanjay Ghemawat安排。原文。这是官方组织披露,不证明调整背后的非公开动机。 ↩↩↩
-
B|Google模型发布与安全披露。 Introducing Gemini 4 Argon,2026-09-30。原文。核验输出上限、分阶段提供、工程案例与防护描述;性能与内部使用结果属于官方披露。 ↩↩↩
-
B|DeepMind研究说明。 AlphaZero and MuZero,研究介绍页,截止日版本。原文。用于自我对弈、学习环境表示与规划的机制,不用于证明通用智能已实现。 ↩
-
B|DeepMind关于跨任务训练边界的说明。 Generally capable agents emerge from open-ended play,2021。原文。公开说明AlphaZero对各游戏分别训练;本报告不把通用算法等同于通用已训练策略。 ↩
-
B|研究团队预印本。 Novikov等,AlphaEvolve: A coding agent for scientific and algorithmic discovery,2025-06-16,arXiv:2506.13131;核验全文。论文|所读全文版本。用于程序演化、特定内核与整体训练收益口径。不是独立部署审计。 ↩↩
-
B|DeepMind实际应用更新。 AlphaEvolve: How our Gemini-powered coding agent is scaling impact across fields,2026-05-07。原文。核验进入计算系统与TPU设计的官方披露;不将其扩大成完整芯片自主设计。 ↩
-
B|Google Research。 Dorfman、Brenner,Accelerating scientific discovery with AI-powered Empirical Research Assistance,2025-09-09,2026-04-29名称更新。原文。核验可评分任务、树搜索、六类任务;不能把更新日期作为新实验日期。 ↩
-
B|公司与学术合作者的同行评审论文。 Gottweis等,Accelerating scientific discovery with Co-Scientist,Nature,2026-05-19,655:487–496。论文。核验结构、合作实验与作者明确限制;同行评审不等于完全独立复现。 ↩
-
B|公司与学术合作者预印本。 Schmidgall等,Accelerating Scientific Research with Gemini in the Real-World,2026-08-27,arXiv:2608.26701。论文|所读全文。核验人工环节、Agent_H及论文评估错误;预印本、任务条件有限。未将样本错误率泛化为所有AI科研的总体错误率。 ↩↩
-
B|研究团队预印本。 Feng等,Towards Autonomous Mathematics Research,2026-02-10,修订版v3:2026-03-06。论文|所读全文。核验Aletheia结构与成功例子稀少的限制。 ↩
-
B|DeepMind科学推理研究介绍。 Accelerating mathematical and scientific discovery with Gemini Deep Think,2026-02-11。原文。核验推理计算、Agent收益及研究贡献等级;结果为官方评估。 ↩↩
-
B|DeepMind研究团队同行评审论文。 Jumper等,Highly accurate protein structure prediction with AlphaFold,Nature,2021-07-15。论文。本次核验摘要与方法介绍,未依赖未读附件细节。 ↩
-
B|DeepMind、Isomorphic等研究团队同行评审论文。 Abramson等,Accurate structure prediction of biomolecular interactions with AlphaFold 3,Nature,2024-05-08。论文。本次核验可检索摘要,完整网页访问受限;只用于联合结构预测范围。 ↩
-
A|外部公共科研基础设施。 EMBL-EBI,AlphaFold Protein Structure Database,截止日版本。数据库说明。用于外部比赛结果与数据库可访问性;数据库由合作方维护,其存在不验证每条预测。 ↩
-
B|DeepMind。 AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome,2026-09-08。原文。核验预计算范围、评分、接口与临床使用限制;合作方实例不是90亿项独立实验。 ↩
-
B|Isomorphic Labs。 Building a new path to make medicines with AI,2026-09-29。原文。用于计算设计—合成—实验—开发链条,不证明已获得临床疗效或批准药物。 ↩
-
B|研究团队预印本。 Feng等,Aletheia tackles FirstProof autonomously,2026-02-24,修订版v3:2026-03-15。论文|所读全文。采用修订版6/10、多数专家意见、首选答案指定与正确性解释,不沿用更高的旧宣称。 ↩
-
B|公司研究团队同行评审论文。 Merchant等,Scaling deep learning for materials discovery,Nature,2023-11-29。论文。用于候选、DFT验证、主动学习及计算稳定性口径。 ↩
-
A|独立学者同行评审观点研究。 Cheetham、Seshadri,Artificial Intelligence Driving Materials Discovery? Perspective on the Article: Scaling Deep Learning for Materials Discovery,Chemistry of Materials,2024-04-08,36:3490–3495。期刊与DOI|所读作者机构保存全文。作者声明无财务竞争利益;其样本批评不是穷尽检验。 ↩
-
B|DeepMind。 Genie 3: A new frontier for world models,2025-08-05。原文。核验交互视觉能力与作者限制;不证明通用物理模拟精度。 ↩
-
B|DeepMind。 SIMA 2: An agent that plays, reasons, and learns with you in virtual 3D worlds,2025-11-13。原文。核验局部经验生成与自改进披露。附属大型PDF读取受限,未用于技术细节推断。 ↩
-
B|Waymo。 The Waymo World Model: A new frontier for autonomous driving simulation,2026-02-06。原文。核验Genie基础上的领域适配、摄像头与激光雷达输出;实际道路数据与模拟验证分开。 ↩
-
B|DeepMind。 Gemini Robotics 2 brings whole body intelligence to robots,2026-07-30。原文。任务数字来自官方公开图表及对应说明;未重建未披露的样本分母或置信区间。 ↩
-
B|DeepMind模型卡。 Gemini Robotics ER 2,2026-07-30。模型卡。核验输出、预期使用与限制;ER文本推理不等于完整物理控制。 ↩
-
B|DeepMind模型卡。 Gemini Robotics On-Device 2,2026-07版本。模型卡。核验可信测试者分发、动作输出、分布外与安全评估范围。 ↩↩
-
B|DeepMind技术报告。 Gemini Robotics 2: Safety Evaluations,2026-07-29。报告。用于安全评估类型;未将语义评估推广为所有物理系统安全保证。 ↩↩
-
B|DeepMind控制路线。 Shah、Flynn,Securing the future of AI agents,2026-06-18。原文。用于内部威胁视角、覆盖/召回/响应及可见推理限制。 ↩
-
B|Google Cloud基础设施披露。 Inside the eighth-generation TPU: An architecture deep dive,2026-04-22。原文。官方比较有条件,本报告不把峰值提升当作实际研发提速。 ↩↩
-
B|公司监管披露。 Alphabet,2026年第二季度业绩,2026-07-22,SEC Exhibit 99.1。监管文件。财务单位为百万美元,正文已换算为亿美元;集团、季度、现金口径分别保留。 ↩
-
A|IEA。 Key Questions on Energy and AI,2026-04-16,Executive summary。报告。全球统计、中央情景与供给预测分别表述,不作为Google项目实测。 ↩
-
B|DeepMind正式安全框架。 Frontier Safety Framework 3.1,2026-04-17。PDF。用于能力定义、关注门槛与决策结构;定义不是能力达到的证据。 ↩
-
A|METR独立研究。 Task-Completion Time Horizons of Frontier AI Models,核验页面最后更新2026-05-08,TH1.1。数据与方法页。本报告未从动态图缺失值推定任何新模型成绩。 ↩
-
A类外部研究线索|尚未独立复现的预印本。 Liu等,Does Learning Protein Folding Generalize to Broader Reasoning?,2026-09-30。论文|所读全文。属于作者实验结果,作为迁移假设线索;不等同于确认通用智能突破。 ↩
-
B|DeepMind Institute官方平台说明。 Legg、Manyika、Hassabis,Introducing the DeepMind Institute,2026-09-16。原文。核验平台职责与作者观点声明;不视为独立治理机构。 ↩
-
A类方法补充|独立机构研究者笔记。 Kwa,Clarifying limitations of time horizon,2026-01-22。原文。页面说明其审查程度低于正式研究文章,并不必然代表METR全体观点。 ↩