人工智能的进化从未如此贴近人类认知的本质。当大多数AI仍在刷题和问答中展示“智力”时,一项名为ARC-AGI-3的全新交互式推理基准测试,正试图将AI扔进一个完全陌生的游戏环境,考察其是否具备人类那样的实时探索、学习与自适应能力。在这条最严苛的赛道上,OpenAI最近交出了一份令人瞩目的答卷——通过两项框架级的工程改进,让GPT-5.6 Sol模型的得分从7.8%飙升至38.3%,提升幅度高达188%。这一AI新闻背后,不仅关乎一个模型分数的跃升,更揭示了当前大模型在“思考连续性”与“记忆持久性”上的核心瓶颈,以及突破这些瓶颈的工程化路径。
从“刷题”到“玩游戏”:ARC-AGI-3为何是AI的终极试炼
传统AI评测体系,无论是GLUE、SuperGLUE还是MMLU,本质上都是“静态题库”模式——模型面对固定的问题,从训练数据中检索或推理出答案。这种模式下的高分,往往意味着模型更擅长记忆和模式匹配,而非真正的智能。ARC-AGI-3则彻底打破了这一范式。它由ARC Prize团队推出,被誉为全球公认衡量AI通用智能(AGI)最严苛的交互式推理评测基准。
在这个测试中,AI不是回答判断题或选择题,而是被投入一个完全陌生的“游戏环境”。这个环境有自己的规则、视觉元素和交互逻辑,模型需要自主探索、理解规则、规划行动,并在有限的操作次数内完成任务。整个过程中,模型必须像人类一样,在试错中学习,在反馈中调整策略,甚至需要维持对“过去发生了什么”的连贯记忆。
这样的设计,实际上将AI的考验从“知识储备”转向了“认知能力”。它要求模型具备: - 实时探索能力:在未知环境中主动获取信息,而非被动等待输入。 - 持续学习能力:从每次交互中提取经验,并用于后续决策。 - 自适应能力:当环境规则发生变化时,能够快速调整行为模式。
正因如此,ARC-AGI-3被认为是通往AGI道路上的一块“试金石”。在OpenAI改进之前,GPT-5.6 Sol的原始得分仅为7.8%,而更早的GPT-5.5模型更是只有0.4%——几乎等同于随机猜测。这组数据清晰地表明,即使是最先进的大模型,在真正的“交互式智能”面前也显得力不从心。
两大“致命缺陷”:官方框架如何束缚了GPT-5.6 Sol的手脚?
OpenAI在复盘时发现,导致GPT-5.6 Sol表现不佳的并非模型本身的能力不足,而是官方测试框架中存在两个严重的设计缺陷。这两个缺陷如同两把无形的枷锁,限制了模型潜力的发挥。
缺陷一:每次动作后私有推理被丢弃
在官方框架中,GPT-5.6 Sol每执行一个游戏动作后,其内部的“私有推理”——即模型在决策前进行的思考、计划、假设和洞察——会被完全清除。这意味着模型每完成一步,就需要重新理解游戏规则,重新规划下一步。虽然它还能看到过去动作的历史记录和简短备注,但这些备注只是“做了什么”,而非“为什么这么做”。
想象一下,如果人类下棋时每走一步就失忆,只能看到棋谱上的落子记录,却完全不记得自己当初的战术意图,那棋力必然大打折扣。GPT-5.6 Sol面临的正是这种困境。它无法积累思考的连续性,每一次决策都像是从零开始,导致大量计算资源被浪费在重复“理解”上。
缺陷二:滚动截断窗口导致早期记忆丢失
即使模型能看到历史动作,官方框架也采用了滚动截断窗口机制——当对话上下文超过一定长度(约175000个字符)后,最早的消息会被自动丢弃。这意味着,在较长的任务中,模型不仅会丢失早期的思考过程,甚至连早期的动作本身也会从记忆中消失。
这种机制有两个致命影响:第一,模型在任务后半段无法引用早期的观察结果,相当于“边做边忘”;第二,随着任务进行,模型始终带着一个“快满”的上下文窗口运行,这本身就会轻微损害模型的表现效率。
正是这两个缺陷,让GPT-5.6 Sol在ARC-AGI-3的测试中如同一个“健忘的探险家”——每次踏入新区域都忘了之前走过的路。
推理保留+上下文压缩:OpenAI的“工程魔法”如何逆转战局?
针对上述问题,OpenAI提出了两个精巧的解决方案:推理保留(Inference Preservation)和上下文压缩(Context Compression)。这两项技术不改变模型本身的参数和架构,而是通过改造外部框架(即“harness”),让模型能够更有效地发挥其固有的推理能力。
推理保留:让思考“保鲜”
OpenAI利用Responses API重新实现了ARC-AGI-3的测试框架。对于GPT-5.6,只需传入前一次response ID,即可在工具调用和多轮交互中自动保留推理过程。具体来说,模型每次决策时的内部推理链不再是“一次性”的,而是被持久化保存,并在后续轮次中可以被模型重新访问。
这一改进的直观效果是:模型不再需要每轮重新解释游戏规则。它可以在第一轮中建立对游戏的理解,然后在后续轮次中直接引用这些理解,从而大幅减少每次动作前的思考时间。更重要的是,保留过去想法后,模型更善于随时间学习,能够采用更连贯的策略——比如记住某个颜色图案的规律,并在后续操作中持续应用。
上下文压缩:让记忆“不丢”
原始框架的滚动截断有两个缺点:丢失早期观察和动作,以及满窗口运行导致的性能下降。上下文压缩技术则通过智能地压缩历史信息来解决这两个问题。它采用一种更高效的编码方式,将早期对话内容进行无损或接近无损的压缩,使得模型在任务的全过程中都能保留对每个游戏的关键信息。
压缩后的上下文不仅占用更少的token,还能让模型在较长任务中保持连贯的“记忆”。例如,在需要几十步操作才能完成的复杂任务中,模型可以始终记得最初发现的关键线索,并据此指导后续行动。
当这两项改进同时启用时,GPT-5.6 Sol的得分从7.8%飙升到38.3%,同时输出的token数量降低至原来的六分之一。这意味着模型不仅变得更聪明,还变得更高效——用更少的计算资源完成了更复杂的推理任务。
从“模型能力”到“框架能力”:Harness工程为何成为AI落地的关键?
这次改进的核心,并不是对GPT-5.6 Sol模型本身进行微调或训练,而是优化了其外部的“harness”(驭缰工程)。在AI领域,harness常被比喻为“驭缰”——它包在大模型外部,提供运行环境、工具集成、规则约束与反馈机制。如果把强大的AI模型比作一匹充满力量但容易失控的烈马,那么harness就是它的缰绳、马鞍与骑手路线。它不改变马本身,却决定了马能否被安全、可靠地驾驭,并真正完成复杂工作。
这一案例深刻地揭示了当前AI发展的一个重要趋势:随着基础模型能力日趋同质化,工程化能力正在成为差异化竞争的关键。同样的模型,放在不同的框架中运行,可能产生天壤之别。
在AI Agent技术的落地实践中,这种“框架工程”的重要性尤为突出。一个AI Agent需要具备多轮对话、工具调用、记忆管理、计划执行等能力,而所有这些功能的实现都依赖于外部框架的设计。OpenAI此次的改进,本质上就是为GPT-5.6 Sol构建了一个更聪明的“Agent框架”,让它能够更好地管理自己的记忆和推理过程。
对于企业而言,这意味着部署AI时不能只关注模型本身,还需要投入精力打造高效的AI工具导航和集成环境。甚至可以说,在企业数字化转型的浪潮中,谁能率先掌握“框架工程”的精髓,谁就能让同样的模型发挥出高出数倍的价值。
行业启示:大模型“记忆翻新”时代的到来
OpenAI在ARC-AGI-3测试上的突破,实际上为整个行业打开了一扇新的大门。长期以来,大模型的上下文窗口限制一直是其核心瓶颈之一。虽然各家厂商不断推出更长的上下文长度(从4K到128K再到1M),但“长上下文”并不等于“好用”。模型在长上下文中对早期信息的注意力衰减、信息检索效率下降等问题,始终困扰着开发者。
OpenAI的上下文压缩方案,提供了一种不依赖模型参数扩展的解决思路。它通过外部框架对历史信息进行智能压缩和重组,让模型即使在有限的上下文窗口中也能保持对关键信息的“长期记忆”。这种思路对于大模型训练后的部署阶段具有重要的参考价值:与其追求无限长的上下文窗口,不如设计更聪明的记忆管理机制。
此外,推理保留技术也让我们看到“思考连续性”的重要性。在许多实际场景中,AI需要持续跟踪一个复杂任务的状态,比如客户服务、代码生成、游戏AI等。如果模型每轮交互都“从头思考”,不仅效率低下,还容易产生前后矛盾。OpenAI的改进表明,通过简单的API设计,就可以让模型维持“思考的连续性”,这为AI图片生成等需要多步骤迭代的创意工具提供了新的优化方向。
当然,这一突破也引发了新的思考:当AI能够像人类一样持续思考、保留记忆,我们是否正在接近真正的通用智能?ARC-AGI-3的38.3%得分虽然远高于之前的7.8%,但距离人类水平的100%仍有巨大差距。但至少,我们看到了通往AGI的道路上,工程改进与基础模型能力同等重要。
未来展望:AI交互式智能的下一站
OpenAI此次的改进,可以看作是在“AI交互式智能”领域的一次重要里程碑。但行业观察者普遍认为,真正的挑战远未结束。
首先,推理保留和上下文压缩目前主要针对单轮决策的连续性,但真实的交互场景往往涉及多个子任务之间的层级调度。例如,一个AI Agent可能需要同时管理多个“思维线程”,并在不同线程之间切换。这需要更复杂的“元认知”能力,而非简单的线性推理保留。
其次,上下文压缩虽然解决了记忆丢失问题,但压缩算法的效率和质量仍有提升空间。如果压缩过程中丢失了关键信息,或者解压成本过高,反而可能影响模型表现。
再者,这一改进目前仅在ARC-AGI-3这个特定测试中验证,推广到其他复杂任务(如代码编写、数学证明、科学发现)时,是否还能保持同样的效果,尚需进一步检验。
对于普通用户来说,这些技术突破最终会以科技产品的形式落地。例如,未来的AI助手可能不再需要你重复说明背景,而是能记住整个对话历史甚至跨会话的记忆;AI游戏NPC可能不再是“背台词”的机器人,而是能真正理解玩家策略并做出智能反应的对手;甚至像AI画图这样的工具,也能在用户多次修改中保持对设计意图的连贯理解。
值得一提的是,最新科技的发展常常伴随着意想不到的跨界应用。比如,推理保留技术中“保留私有推理”的思路,或许可以启发我们设计更智能的抠图工具——让AI在每次操作后保留对“边缘判断”的推理过程,从而在后续操作中更准确地理解用户意图。
当然,每一项技术都有其适用范围。对于需要快速迭代的AI诗词创作或藏头诗生成等趣味应用,上下文压缩可能并不必要;但对于需要长期记忆的AI网名生成器,保留用户的历史偏好就显得至关重要。
FAQ
Q1: 什么是ARC-AGI-3基准测试?
A: ARC-AGI-3是由ARC Prize团队推出的交互式推理基准测试,被公认为衡量AI通用智能(AGI)最严苛的评测标准。它要求AI在完全陌生的游戏环境中自主探索、学习和自适应,而非回答静态知识问题,是AI新闻中备受关注的“终极试炼”。
Q2: 推理保留和上下文压缩有什么区别?
A: 推理保留解决的是“思考连续性”问题——让模型在每步操作后不丢失内部推理过程,从而保持策略连贯;上下文压缩解决的是“记忆持久性”问题——通过压缩历史对话避免因上下文窗口截断而丢失早期信息。两者结合,让模型在长任务中既能记得自己想了什么,也能记得自己做过什么。
Q3: 这两项改进对AI行业有什么实际影响?
A: 它们展示了工程化框架的重要性:同样的模型,通过优化外部框架可以获得数倍性能提升。这启示企业部署AI时应重视“框架工程”而非只关注模型本身。未来,AI助手、Agent、游戏NPC等科技产品将受益于更连贯的记忆和推理能力,推动交互体验质的飞跃。
图像生成提示
A futuristic AI testing environment: a glowing digital brain connected to a complex game-like grid with colorful tiles, with arrows and data streams representing “inference preservation” and “context compression”. The scene is clean, cyberpunk style, with a large 188% score floating above. Dark blue and neon cyan tones, photorealistic 3D render.