不改权重改环境推理期强AI如何用“脚手架”让弱模型逆袭Salesforce AI ResearchSalesforce 人工智能研究院 与 UIUC伊利诺伊大学厄巴纳-香槟分校 共同合作研究发表研究结果这项研究探讨了推理时支架Strong-to-Weak Scaffolding这一新型能力迁移范式即利用强大的构建模型为较弱的目标模型设计推理工具包而非通过传统的参数更新进行蒸馏。实验通过心理理论Theory-of-Mind基准测试发现即便不更新权重这种自动生成的支架也能将目标模型的平均准确率从0.49大幅提升至0.91。性能的增长主要归功于将不稳定的逻辑推理外包给确定性代码、实施基准路由以及严格的格式约束。研究还表明构建模型的推理投入与支架质量呈正相关且这种方式在剩余提升空间较大的弱模型上效果最为显著。总之该成果证明了通过优化推理环境来转移模型认知的可行性为提升低成本模型的性能提供了新路径。核心结论测试时能力转移Test-Time Capability Transfer极其高效且稳健 “强到弱脚手架”通过在推理阶段Test-Time为弱目标模型构建外部推理环境脚手架能够实现巨大的、且普遍为正向的能力转移而无需任何参数微调。在大规模实验共 72 个运行中这种范式展现出高一致性与鲁棒性100% 的运行和所有 11 种 Builder 模型配置均超越了无脚手架基线。“认知负荷降低与结构化”是核心驱动力 表现提升的主要驱动力并非是迫使弱模型进行更长、更广的推理而是降低其认知负荷确定性卸载Deterministic Offloading利用代码和规则直接接管不稳定的模型推理。在脚手架中由确定性代码/规则回答题目的占比Determinism fraction与最终成绩有极强的正相关。输入结构化Structuring将剩余必须由模型处理的任务收窄通过精细设计提示词提供更清晰的输入、控制输出格式和缩小推理焦点。“余量法则”The Headroom Law决定了收益边界 脚手架对目标模型的能力提升幅度Uplift高度预测自该模型在此任务上的“余量”Headroom即 1−Baseline1−Baseline。这意味着脚手架主要是在收复和释放弱模型已有的潜在能力Latent competence。对于已经接近能力天花板的强目标模型过度脚手架设计Over-scaffolding甚至可能会“反噬”干扰其原本正确的推理逻辑。Builder 的能力与推理努力决定了脚手架的上限 Builder 模型的类型和构建时的推理努力Reasoning Effort是决定脚手架质量的核心变量其影响力远大于编写代码的平台如 Cursor, Claude Code, GPT Codex。让 Builder 模型在编写脚手架时进行更深入的思考其生成的代码量更长编译的任务逻辑更丰富脚手架质量呈明显的单调上升趋势。极其高效的验证迭代高泛化无过拟合 Builder 模型能够利用极其有限的验证集样本仅 5% 数据通过极少数轮次的高效迭代设计出具有极强泛化性的优秀脚手架而不会产生严重的过拟合。残余错误标记了任务的“可编译性”边界 无法被脚手架解决的“硬骨头”主要集中在无法被代码或规则完全编译Less-compilable的深度心智推理任务包括深层信念递归如 Hi-ToM 深度 ≥2≥2 且伴有欺骗机制的场景以及复杂的贝叶斯目标推理MMToM-QA 的“which container/goal”问题。关键量化数据总体表现与提升数据目标模型为 GPT-5.4-mini 时无脚手架基线 (Vanilla Baseline)GPT-5.4-mini 宏平均准确率仅为0.488。无脚手架强模型基线更强的 GPT-5.4 在无脚手架时的表现也仅为0.619。脚手架平均成绩 (Mean of Scaffolded Runs)提升至0.763绝对提升0.275。最佳运行表现 (Best Run)由GPT-5.5在 GPT Codex 平台上为 GPT-5.4-mini 编写的脚手架达到了0.912绝对提升0.423相对提升87%大幅超越了无脚手架的 GPT-5.4 大模型并逼近人类设计的 UserHarness0.939。关联性及机制指标Pearson/Spearman 相关系数确定性卸载率与最终成绩Pearsonr 0.72卸载比例越高准确率越高。验证集最高分与测试集分数极强正相关 Pearsonr 0.96验证集是非常忠实的代理指标。目标模型余量与能力提升强相关 Pearsonr 0.75余量越大提升越多。Builder 推理努力阶梯与性能Opus-4.7 在低、中、高、特高推理努力下的表现呈强单调正相关Spearmanρ 0.77。验证迭代次数与最终成绩几乎无相关性Pearsonr 0.17说明 Builder 本身设计假说的质量远比单纯增加测试轮次更重要。验证集迭代效率极简验证切片仅使用5%的验证样本进行迭代195个样本。中位数迭代次数仅为5 次平均 4.9 次。乐观偏差极低 (Optimism Gap)验证集与测试集的平均成绩差距仅为0.021(2.1%)无显著过拟合。平台与目标模型对比平台差异平台原生优势极其微弱平均 native 优势仅为0.013且不显著p 0.484。Gemini-3.5-flash 作为目标模型Baseline 较高0.761脚手架辅助下平均提升至0.871绝对提升0.110。主流技术采用率基于 GPT-5.4-mini 作为目标模型的 57 个运行格式强制执行 (Format enforcement)100% (57/57)温度控制与贪婪解码 (Greedy/temp control)98% (56/57)基准路由 (Benchmark routing)95% (54/57)极性/否定逻辑 (Polarity/negation logic)79% (45/57)确定性求解器 (Deterministic solver)54% (31/57)结构化状态提取 (Structured extraction)51% (29/57)任务“可编译性”数据确定性代码/规则回答题目占比BigToM高达~94%最容易被编译为规则甚至在最佳脚手架下取得了 1.00 的满分成绩。Hi-ToM约51%。MMToM-QA约44%。MuMA-ToM约36%最难被编译大量依赖纯模型推理。深层心智推理Hi-ToM的衰减数据Top-8 最强脚手架汇聚递归阶数表现0阶0.999→→ 1阶0.814→→ 2阶0.736→→ 3阶0.754→→ 4阶0.700高阶递归仍然是硬骨头。欺骗机制影响无欺骗DeceptionFalse时为0.829有欺骗DeceptionTrue时降至0.772。https://arxiv.org/html/2608.12307v1