OpenAI两项改进让GPT-5.6 Sol在AI基准ARC-AGI-3上提分188%

发布时间:2026-07-31 17:39

  OpenAI 公司今天发布公告,宣布通过改进框架,

  注:ARC-AGI-3 由 ARC Prize 团队推出的全新交互式推理基准测试,是目前全球公认衡量 AI 通用智能最严苛、最顶尖的交互式推理评测基准。

  该基准完全打破了传统 AI“做题”和知识问答的静态测试模式,将 AI 直接扔进一个完全陌生的“游戏环境”中,来评估其是否具备像人类一样的实时探索、学习与自适应能力。

  第一,每次游戏动作后,私有推理都会被丢弃。这意味着 GPT-5.6 Sol 每执行 1 次动作后,都需要重新理解游戏。模型仍可看到过去动作记录和简短备注,但看不到促成这些动作的计划、洞察和思考过程。

  第二,官方框架采用滚动截断窗口。随着历史变长,较早动作会从上下文中消失。也就是说,GPT-5.6 Sol 不仅无法保留过去思考,也会丢失过去动作记忆。

  OpenAI 表示在启用推理保留后,GPT-5.6 不必每轮重新解释游戏,从而减少每次动作前花在思考上的时间,模型保留过去想法后,更善于随时间学习,并采用更连贯的策略。

  在上下文压缩方面,官方 ARC-AGI-3 框架在对线 个字符后,会丢弃最早消息。OpenAI 称,滚动截断有 2 个缺点:模型会丢失早期观察和动作;模型在任务的大部分时间里会带着更满的上下文窗口运行,这可能轻微损害表现。

  启用上下文压缩后,GPT-5.6 Sol 在较长任务中更能保留对每个游戏的已学信息,并以更少输出 token 获得更高得分。

  harness是指包在大模型外部、为其提供运行环境、工具集成、规则约束与反馈机制的整套系统架构。

  如果把强大的 AI 模型比作一匹充满力量但容易失控的烈马,那么 harness 就是它的缰绳、马鞍与骑手路线,不改变模型本身的架构,而是决定模型如何被安全、可靠地驾驭并真正完成复杂工作。

  特别

  NBA重磅4方交易方案!哈登为争冠再牺牲,推迟签约助骑士追锋线万人口,阿富汗女人为啥越乱越爱生娃?

  健身房里被人当众指责偷拍 男子报警只等来电线岁女孩凌晨和朋友在景区游玩 脚下木板裂开落水溺[*]

  健身房里被人当众指责偷拍 男子报警只等来电线岁女孩凌晨和朋友在景区游玩 脚下木板裂开落水溺[*]

排行

精选