
编辑|Panda白银防火门胶
7 月 16 日,伯克利博士后 Haven Feng 的条文火了。原因他,结果很震撼:在 ARC-AGI-3 Public 集上,套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组后达到 98.98 的 RHAE;换成 GPT-5.6 Sol 组,分数也有 95.35。
怎么做到的?Feng 的文表示:「[schema] 让 LLM 像物理学样思考。」
这条文很快被转到 55 万次浏览。
要理解这些成果的分量,得先看它站在什么位置上。ARC-AGI-3 今年 3 月上线时,强的前沿智能体只拿到 0.51。到 7 月,官验证过的好成绩是 GPT-5.6 Sol 在理档下的 7.78(半私有集),公开集也才 13.33。个跑了近半年、被 ARC-AGI 和 Keras 创造者 François Chollet 判断「大约还能撑年」才会饱和的基准,被几乎穿了。
真正值得注意的不是分数本身,而是它来自哪里:模型权重个字节都没动,变的只是模型外面那层「壳」。也就是当前大热的 Harness,它把「观察、提出假说、设计实验、修正规则、规划执行」串成不可跳过的闭环,并让模型把理解写成可以运行、回放和修改的「世界程序」。拉开差距的,不只是模型会不会理,是 harness 能否把理变成套可验证的行动流程。
而就在整个 AI 圈还在比拼谁的模型大、理强时,[schema] 给出了个不太样的答案:有时候,问题不在模型,而在你怎么用它。
[schema] 是什么?
先,先简单介绍下 ARC-AGI-3。
这是个「不告诉你规则」的游戏基准。它给智能体块 64×64 的网格、16 种颜、几个法操作,然后什么都不说:没有物体清单,没有目标说明,没有励信号。智能体只能边玩边猜,包括猜网格里哪些像素是「玩」、哪些是「墙」,猜某个操作会让世界怎么变,猜什么「过关」。
而 [schema] 则是套在大模型外面的层 harness。它不重新训练模型,而是逼着模型用种特定的式工作:把每关的机制写成段可以运行的程序,拿这段程序去对照历史记录做验证,再在程序里搜索出通关路径。
链接:https://mp.weixin.qq.com/s/BbOBM0A-znQtVSDRcDK6zw
[schema] 来自 Impossible Research、加州大学伯克利分校与卡内基梅隆大学研究者的作。名字借自康德的「图式」概念白银防火门胶,意指连接抽象概念与具体感知的套构造规则。落到工程上,它是层 harness,也就是包裹在大模型外部的工作框架。
网友:印象刻,也有人喊「作弊」
结果出,讨论热烈。
有人直接被数字震住。位网友感叹,公开集从 7.8 跳到 99 是「实实的大步」。也有人开始想远的问题:这套外壳到底跟什么样的模型能力匹配?换个模型还成立吗?
但质疑同样不少。有人半开玩笑地贴出段伪代码,调侃道:「我们造了个能下棋的大模型。」「什么突破?」「我把棋局输进去,往后站,看它。」——言下之意,真正干活的是搜索法,不是模型。还有人直接:「有没有可能,这里面有点作弊?」
有分量的评价来自 ARC Prize 总裁 Greg Kamradt。他面肯定这项工作,说核心思路他很欣赏:把世界模型的隐含表示写成程序而非向量,于是它可以被读、被 diff、被逐条回放验证,还能当模拟器来费搜索。「这讲得通,我喜欢。」
https://x.com/GregKamradt/status/2077949388673151332
另面,他也点出几处存疑。
其,两个分数都用了条固定的「兜底规则」:先跑 Opus 4.8 和 Sol xhigh,凡是单局低于 80 分的,再换 Fable 5 和 Sol max 重跑遍,取两者里的分。在他看来,ARC-AGI-3 的精是让智能体在毫先验的情况下面对游戏,旦你根据「哪局跑得好、哪局跑得差」来切换模型,就等于把人和环境的信息注入了流程。
其二,官文档里出现了「玩」「墙」「计数器」这类词。如果这些概念是人告诉模型的,那所谓的成绩就同时来自模型和人,「而我们早就知道人类得分很,那就没那么有意思了」。
Kamradt 也强调,98.98 和 95.35 都是团队在公开集上的自报告结果,ARC Prize 尚未立复核。[schema] 团队自己在博客里也主动写明了这点。
核心:把世界模型写成段可以运行、可以证伪的程序
现在进入正题:[schema] 到底怎么工作的?白银防火门胶
博客地址:https://schema-harness.github.io/
、像物理学样,先决定「定律是关于什么的」
物理学写下条定律之前,得先决定这条定律说的是什么:观测里哪些部分是物体?哪些属定义了状态?想清楚这些,才谈得上问「状态怎么变」。
[schema] 把这件事拆成两个问题。
状态落地(state grounding):把原始像素变成能追踪的物体、变量和关系。
机制发现(mechanism discovery):找出这些状态在次操作下如何改变,并把规则写成段可运行的程序。
关键在于,这两个问题不能分开解。个乍看理的状态表示,可能在后续实验里露馅,因为你找不到任何条致的规则能解释接下来发生的事。
[schema] 的做法是把状态表示和转移规则编码进同段可编辑的程序:旦某个观测跟预测矛盾,智能体既可以改规则,也可以改「状态到底是什么」,再回过头调整另半,让整个模型重新自洽。
团队举了个漂亮的例子:狭义相对论的诞生。迈克尔逊-莫雷实验测不到光赖以传播的「以太」时,洛伦兹选了条路:保留以太,用收缩假设去补丁,硬把结果吸收掉。因斯坦选了二条:干脆把以太从「状态」里删掉,让同时变成相对于参考系的,于是得到了套简洁的运动电动力学。当预测反复失败,物理学改的不只是定律,而是「状态是什么」。
二、把世界模型当程序,于是它可读、可验、可搜
这是 [schema] 核心的步,PVC管道管件粘结胶也是 Kamradt 欣赏的地。
在大多数系统里,模型对世界的理解是个向量,藏在网络内部,看不见摸不着。[schema] 反其道而行:它把这个「潜在世界表示」写成段代码。好处有三。
它是可解释的:个你能读、能比对差异的文本文件白银防火门胶。
它是可验证的:可以拿着历史记录条条回放,逐个信念地检查对不对。
它是可搜索的:段程序本身就是个模拟器,在里面做规划不花任何真实操作。
三、外循环:观察、演、执行、记录
[schema] 让智能体对着游戏跑个四阶段循环:观察 → 演 → 执行 → 记录。
记录这环是不可篡改的交互历史。智能体可以随时修改自己的假设和笔记,但改不了它收到过的观测和做过的操作。每轮演里,智能体把当前理论新成段 step(state, action) 程序,用 run_backtest 拿它去对照全部历史记录,哪里对不上就定位错误,然后用 run_bfs 在模型里搜出条路径,把结论写进 notes.md。这些操作全都不碰真实环境,只有 commit_actions 才会真的把操作发给游戏。
这里有条硬规矩:现实的优先于模型。执行过程中,每次真实的状态转移都会拿去跟理论预测比对。只要有处对不上,当前计划立刻中止,智能体带着这个「反例」回到演,须先修好模型才能重新规划。
还有个容易被忽略的细节:智能体不只为了通关而行动,它也会主动做实验。当好几条候选规则都能解释历史时,它会去找个「能把它们区分开」的操作;各条规则对这个操作的预测不样,做次就知道谁对。这种有针对的试探本身也很省,因为 RHAE 对多余操作施加的是平惩罚,好的实验就是用少的真实交互解决多的不确定。
四、数字到底说了什么
得先搞清楚 RHAE 怎么。它比较的是智能体和「次接触的人类基线」各用了多少操作,单关得分是(人类操作数 ÷ 智能体操作数)的平,上限 1.15。越靠后的关权重越,且只有通关全部关卡才可能拿到满分。所以 98.98 是个把完成度和操作率揉在起的综指标。
因为比值被平了,多走冤枉路的代价非常大。团队给了个直观对比:智能体 A 用 785 步部 7 关,逼近人类的 776 步,拿到 97.7;智能体 B 花了 1591 步、是人类的 2.7 倍,还卡在 6 关没完,终得分不到 14。
真正干净的对照来自 Claude 这行。同样是 Opus 4.8 加 Fable 5 的组,把 Claude Code 的通用外壳当基线,只拿到 42.83;换成 [schema],同对模型冲到 98.98,提升 56.15 个百分点。变量只有外壳,模型没动。
至于那条从 13.33 到 95.35 的巨大落差,团队自己也说了:这不是场对等的 harness 对比,Sol max 的 13.33 是官在简外壳下报的好单变体成绩,两者不在个口径上,只能作背景参照。
写出程序之后,模型能少走多少弯路
团队分析发现,在 25 个游戏中,有 14 个游戏被模型诱出能精确复现历史的程序世界模型。在这些游戏里,智能体的实际动作数比人类基准少 1.6 至 5 倍。原因并不秘:发现机制需要付次真实交互成本;旦 step 和 is_goal 经验证,后续关卡的规划就能在模拟器内完成。
个端案例是 M0R0 的 4 关。团队称,智能体用了 42 次动作,人类基准是 500 次。这里的「省」不意味着模型从开始就知道答案,而是它把前几关找到的机制保留下来,之后只需重新计路线。可迁移的不是某个具体动作序列,而是解释这些动作为何有的程序。
另个对比也很能说明问题。在 FT09 游戏中,Fable 5 起初把个棋盘样图案视为不可点击的装饰。当前目标逻辑看似已经满足,关卡却不进。它于是换了个基础的问题:这个「提示」本身会不会就是可操作对象?次探测揭示,这是类似「熄灯游戏」的十字按钮,会翻转自身及上下左右。Fable 随即把机制编码,11 步后过关,下关只用了 13 步。
同在 Schema 框架里的 Opus 4.8 终也发现了同规则,但它先在原有表示中反复修补目标状态,约多花 240 次动作才去点击那个图案。两个模型都能写出正确程序,差别不在后能否表达规则,而在何时怀疑自己的表示、如何挑选能区分假设的实验。框架降低了「用理论」的成本,底座模型决定了「发现理论」的成本。
结语:这是起点,不是终点
有点需要冷静。[schema] 的所有数字都测在 25 个公开游戏上。而 ARC-AGI-3 的公开集,按官说法本就比私有集容易得多,官也从不在正式榜单上报告任何系统的公开集分数。Sol max 那唯个跨集校准点(公开 13.33 对半私有 7.78)恰恰说明,公开集上接近满分,不代表半私有集上也接近满分。98.98 在半私有集上对应到什么,在真正测出来之前,人知晓。
但抛开分数的口径之争,[schema] 指向的东西是清楚的:让模型把对世界的理解显式地写成可运行、可证伪的程序,再逼它用行动去做实验、拿现实去否证假设。这套「分析-综」的循环,本质上就是科学法本身。
团队把穿公开集称作「个新的开始」,而非终点。他们真正想探索的,是把「机制发现」当成种通用能力:在远比 64×64 网格丰富的环境里,通过行动与感知的循环,去锚定个世界的因果结构。ARC-AGI-3 只是块试验田。
多详情请访问原博客。相关词条:离心玻璃棉 塑料挤出机 钢绞线厂家 铝皮保温 pvc管道管件胶
奥力斯 万能胶生产厂家 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定白银防火门胶,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
