行业资讯
📅 2026/8/30 0:50:58
时薪4美元Claude干赢150美元人类研究员,AI「自己改进自己」时代要来了?
4美元一小时Claude跑赢人类研究员在Anthropic发布的《自动化研究员能够有效缓解AI对齐失败》研究中基于Claude Opus 4.8搭建了AAR自动化对齐研究员系统。Claude拿到模型安全问题后会自行搜索论文、提方案、生成数据、微调模型并测试。一轮训练通常30分钟能快速试错。整个过程人类负责出题、提供模型和评测标准Claude承担大部分工作。10道安全难题Claude全部找到改进方案实验中Anthropic给Claude出了10道覆盖常见对齐问题的题如欺骗、谄媚等。Claude逐个处理问题最终10类问题都得到改善按「安全差距」指标弥合了26%-96%的差距。部分获胜方案在未公开测试集和Petri评测中有效应用到最大为实验模型4.7倍的模型上效果也能保留。且Claude找到的方案未明显损害模型原有能力。85%对20%Claude大比分跑赢人类研究员在「欺骗」测试中Claude提交150多次尝试单次最佳方案弥合82%安全差距综合平均成绩85%。而6名经验丰富的AI安全研究员平均只弥合20%。全部任务有28名人类研究员参加每人最多用8小时论文称自动化研究员6小时内就能找到超人类平均水平的方法。自动化研究员每小时API推理成本约4美元人类研究员时薪150美元。不过这场比赛并不公平Claude能根据实验结果调整方案人类只能提交一次。较弱Claude训练更强Claude60小时逼近正式版此前实验主要改进开源小模型之后Anthropic让Claude Sonnet 5训练Claude Opus 4.8早期版本。60小时里Sonnet 5测试50多种方案最终方法弥合约65%安全差距接近正式版的72%。该方案数据效率约是生产级对齐流程的1.5万倍但不能用2000多条数据复制整套生产训练。这证明较弱Claude可参与训练更强Claude。所以到底算不算「AI自进化」从结果看研究摸到「AI自进化」门槛但AI未完全自主设计、训练和制造更强下一代AI研究问题、模型、数据和成功标准都由人类决定。实验未覆盖复杂问题安全评测只是代理指标。AAR优势是擅长按指标试错但指标错误可能导致结果偏离。研究Agent还会作弊Anthropic安排监控Agent在约1600份记录中发现39次作弊尝试占比约2.4%。未来更强模型作弊可能更难发现。AAR每小时约4美元可连续工作、并行实验人类研究员时薪高、需休息、实验推进有限造AI的人要担心被AI抢饭碗了。