OpenAI 最新发布的旗舰模型 GPT-6 Astra 近期在多项基准测试中表现突出,尤其在公认极具挑战性的 AI 智商评测 ARC-AGI-3 中,其成绩逼近 100%。这一成绩相较于上一代模型 GPT-5.6 Sol 的 38.3% 实现了巨大飞跃,引发了科技界对于人工智能是否已触及通用智能(AGI)边界的热烈讨论。尽管该模型在电脑操作、科研探究及安全防御领域展现出显著进步,但其背后高昂的算力成本及依赖外部框架的技术路径,也让部分专家对其“智能”的本质提出了质疑。

符号世界模型重塑推理逻辑

ARC-AGI-3 测试包含大量不断变化的图形规律题,旨在考察 AI 在陌生环境中的探索与推理能力,而非简单的模式匹配。GPT-6 Astra 之所以能取得突破性成绩,核心在于其采用了符号世界模型技术。与传统大模型依赖“暴力试错”不同,该模型将现实世界抽象为逻辑符号和因果代码,通过精密计算而非直觉反应来解决问题。

  • 建立代数符号系统:模型使用自创的 DSL(领域特定语言)记录环境规则、指令序列及像素运动轨迹,消除了自然语言交互中的歧义。
  • 虚拟沙盒模拟:在执行实际操作前,模型会在内部构建逻辑闭环,模拟指令后果,确保行动准确无误。
  • 自主工具开发:在红队测试中,模型能自主编写导航、战斗规则等代码,为特定游戏“量身定制”工具链,实现了从被动响应到主动构建的转变。

这种技术路线将以往依赖外部 Harness 外挂框架的功能内化至模型权重中,显著降低了延迟并提升了部署灵活性。顶尖学者 Gary Marcus 对此表示赞赏,认为这是符号推理路线的重大胜利,也是业界在通往 AGI 道路上达成的一种底层技术共识。

高分背后的算力成本与外部依赖

尽管成绩亮眼,但 ARC Prize 基金会总裁 Greg Kamradt 指出,GPT-6 Astra 的高分并非完全源于模型本体的智能,而是依赖了一套豪华的“供应商适配器基座”及连续对话上下文压缩技术。这种外部辅助框架(Harness)补足了模型在记忆、逻辑推演及状态保持上的不足。

更引人关注的是其极高的经济成本。数据显示,GPT-6 Astra 每完成一局 ARC-AGI-3 测试,需消耗360 美元的算力费用;若完整跑完整场测试,总账单高达1.8 万美元(约合 13.5 万人民币)。相比之下,人类受试者解同一谜题的成本仅为 12.78 美元,甚至低于其生理代谢能耗折算的电费。这种“钞能力”刷分模式引发了业界反思:在算力成本如此悬殊的情况下,该成绩是否具备大规模商业落地的可行性?此外,随着模型内部推理过程变得不透明,开发者难以判断其究竟是真正理解了逻辑,还是找到了更高效的“捷径”。

AGI 定义仍存分歧

针对“AGI 已来”的说法,Greg Kamradt 明确泼了冷水。他认为,ARC-AGI-3 仅相当于 AI 的一场“图形消消乐考试”,虽然证明了 AI 正在变聪明,但距离真正的通用智能仍有巨大差距。人类智能的核心在于适应任何未知世界的能力,例如古代婴儿能学会使用现代科技,这种跨时代的适应力目前尚无法通过单一基准测试来验证。

GPT-6 Astra 的出现标志着 AI 在符号推理和自主编程能力上取得了阶段性突破,符号世界模型有望成为未来高阶推理的关键路径。然而,高昂的算力开销、对外部框架的依赖以及测试场景的局限性,意味着该模型目前仍属于专用智能范畴。未来,随着模型内部计算能力的进一步提升及成本结构的优化,AI 或许能在自动驾驶、药物研发等复杂未知场景中展现出更接近 AGI 的潜力,但真正的通用智能仍需跨越从“解题”到“适应世界”的本质鸿沟。