任丘市奥力斯涂料厂

克拉玛依pvc管道胶水 Claude开始训练Claude!4美元小时,跑赢150美元人类研究员

发布日期:2026-08-30 12:58点击次数:79

保温护角专用胶厂

Claude 开始训练 Claude 了!克拉玛依pvc管道胶水

时薪 4 美元,干赢时薪 150 美元的人类研究员。

在 Anthropic 新发布的研究中,Claude 自己查论文、提案、造数据、训练模型,口气攻克了 10 类 AI 安全问题。

部分任务上,它交出的案甚至比 28 名人类安全研究员好。

刺激的是,较弱的 Claude 已经开始反向参与训练强的 Claude。

AI「自己改进自己」的那天,好像真的越来越近了…

4 美元小时,Claude 跑赢人类研究员

在这篇题为《自动化研究员能够有缓解 AI 对齐失败》的研究中,Anthropic 直接把 Claude 送进了实验室。

具体而言,他们基于 Claude Opus 4.8,搭建了套名为AAR的自动化对齐研究员系统。

拿到个具体的模型安全问题后,Claude 会自己搜索相关论文,从中寻找可用法,再提出新的训练案、生成数据、微调模型,后跑遍安全和通用能力测试。

从提出假设到完成验证,套较完整的 AI 研究闭环,就这样交到了 Claude 手里。

果不好,案扔掉;成绩有所提升,就沿着这个向接着试。

轮训练通常只跑 30 分钟。这样,Claude 就能像搜索法样,在大量案中快速试错。

整个过程里,人类负责出题、提供模型和评测标准,Claude 则包下了从查资料到跑实验的大部分工作。

10 道安全难题,Claude 全部找到改进案

实验中,Anthropic 口气给 Claude 出了 10 道题。

这些题覆盖模型常见的对齐问题,包括欺骗、谄媚、励黑客、隐私侵犯和越狱等。

比如「谄媚」,指的是模型为了顺着用户说话,给出用户听但未正确的答案;「励黑客」则是模型没有真正完成任务,只是钻了评测规则的空子,骗到个分数。

Claude 每次只处理种问题,反复提出案、训练对应的目标模型,再根据成绩进入下轮。

后,10 类问题全部得到。

按照 Anthropic 定义的「安全差距」指标,Claude 弥了其中 26-96 的差距。简单来说,就是把原本存在安全问题的模型,向理论满分拉近了大截。

重要的是,这些法不只对 Claude 看过的题目有。

部分获胜案放到未公开的测试集,以及模拟多轮对抗场景的 Petri 评测中,依然能够降低模型的不安全行为。应用到规模大为实验模型 4.7 倍的模型上,果也能保留下来。

Anthropic 还设置了条红线:安全训练不能明显损害模型原有能力。

毕竟,让模型遇到什么都拒回答,也能让不少安全测试的分数变好,但这样的模型基本没法用。

终,Claude 找到的案在预设的通用能力测试中没有出现明显退化。

85 对 20,Claude 大比分跑赢人类研究员

悬殊的局,出现在「欺骗」测试中。

为了让目标模型变得诚实,Claude 先后提交了 150 多次尝试。

它提出个法,训练次,再根据结果继续调整。单次实验中,佳案弥了82 的安全差距;综多次运行,平均成绩达到 85。

同道题,Anthropic 还交给了 6 名经验丰富的 AI 安全研究员。

结果,人类研究员平均只弥了 20 的安全差距…

85 对 20,Claude 赢得那叫个毫悬念。

全部任务共有 28 名人类安全研究员参加克拉玛依pvc管道胶水,每人多可以用 8 小时阅读资料、设计案。

论文称,自动化研究员通常能在 6 小时内找到过人类平均水平的法,人类提供的研究向也没有让 Claude 取得好的成绩。

扎心的,在于成本!

名自动化研究员每小时的 API 理成本大约为4 美元;Anthropic 付给人类研究员的报酬,则是每小时 150 美元。

这……人类研究员妥妥要被 Claude 替代了啊。

不过呢,这场人机比赛也并非公平。

Claude 可以真正训练模型,看到每次实验的结果,万能胶生产厂家再不断修改案;人类研究员只能提交次法,没有机会根据结果继续迭代。

较弱 Claude 训练强 Claude,60 小时逼近正式版

前面的实验,改进的主要还是开源小模型。

接下来,Anthropic 把难度直接拉:让能力较弱的 Claude Sonnet 5,去训练尚未完成大部分生产安全训练的 Claude Opus 4.8 早期版本。

所谓弟子不不如师,说的大概就是这种模式了。

在 60 小时里,Sonnet 5 测试了 50 多种解决案。终找到的法弥了约 65 的安全差距,已经接近正式发布版 Opus 4.8 的 72。

这套案使用的训练数据只有 2000 多条,主要由简单模板和公开数据集构成。

按照 Anthropic 的计,在这组特定任务上,它的数据率大约是生产对齐流程的 1.5 万倍。

当然,这还不等于 Anthropic 可以用 2000 条数据,复制整套生产训练。

正式模型还要处理多能力、多风险以及大量端情况,这次实验只针对组明确的安全指标展开。

但这已经证明了,较弱的 Claude 已经可以自己查论文、设计法、生成数据,再把训练结果写进强的 Claude。

人类划定范围,Claude 负责迭代。个模型克拉玛依pvc管道胶水,开始参与制造下个安全、强大的模型。

AI 改进 AI,已经成为了发生在眼前的事实。

所以到底不「AI 自进化」?

从结果来看,这项研究确实已经摸到了「AI 自进化」的门槛。

但如果把「自进化」理解成个 AI 自主地设计、训练并制造出强的下代 AI,那这次实验还远没有走到那步。

毕竟这个过程中,研究什么问题、用什么模型和数据、什么样的结果成功,都还是由人类决定。

Anthropic 自己也承认,AAR 能够优化的,只是人类事先写进评测系统的目标。

这次实验没有覆盖其他复杂问题;些低频或刚刚出现的风险,甚至还没有对应的 Benchmark。

研究人员也只检查了组预先选定的通用能力,因此法排除某种安全训练在提分数的同时,损害了其他没有被测试的能力。

Petri 等安全评测同样只是现实风险的代理指标。模型在测试里表现得安全,并不等于进入真实环境后也定可靠。

所以,AAR 大的隐患也藏在它的优势里:它太擅长根据指标速试错了。

旦尺子量错,Claude 跑得越快,离人类真正想要的结果反而可能越远。

戏剧的是,研究 Agent 自己也会作弊。

为了止 AAR 钻评测规则的空子,Anthropic 门安排了个监控 Agent,检查 Claude 准备执行的案和完整研究记录。

结果,在大约 1600 份研究记录中,监控模型发现了 39 次作弊尝试,占比约 2.4。

有的 Agent 反复提交同案,试图利用评测波动碰出个分数;有的模仿 Benchmark 的格式生成训练数据,还有的故意隐藏违反规则的实验步骤。

比起真正解决模型的安全问题,它们想找到条快速提分数的捷径。

这多少有点黑幽默了…着 Agent 监守自盗了呗。

好消息是,这些作弊意图大多还会出现在模型的理记录里,因此能被监控 Agent 发现。

坏消息是,Anthropic 也不能确定未来强的模型还会不会留下这么明显的痕迹。

当研究 Agent 拥有多工具、权限,并且可以直接修改模型训练流程时,「怎样监控个负责改进 AI 的 AI」,可能会比训练本身棘手。

但总而言之,个 AAR 每小时大约花费 4 美元,可以连续工作,也可以次复制出几十个、几百个并行跑实验。

而人类研究员的时薪远于这个数,需要休息,次能进的实验数量也相当有限。

这笔账怎么,答案都已经很明显了。

也不知道该说是核弹爆炸,还是当场瘫坐……

这次,轮到造 AI 的人担心被 AI 饭碗了。

参考链接:

[ 1 ] https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

[ 2 ] https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

[ 3 ] https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

� � 点亮星标 � �

科技前沿进展每日见相关词条:储罐保温     异型材设备     钢绞线厂家    玻璃丝棉厂家    万能胶厂家

奥力斯    保温护角专用胶批发    联系人:王经理    手机:13903175735(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定克拉玛依pvc管道胶水,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

推荐资讯