行业资讯
📅 2026/8/15 22:44:08
10 万亿参数大模型,注定要被关进笼子里
它能行的善与恶都将超出人类想象。OpenAI即将发布的GPT-6传闻称它的参数量高达10万亿。10万亿是一个非常恐怖的概念。现如今全球顶尖大模型的参数量都在“万亿”级别。比如阿里的Qwen 3.8为3.5万亿KimiK3为2.8万亿字节内部正在开发的模型也有数万亿的参数量哪怕是OpenAI的Mythos 5估算也只有8万亿。10万亿代表了一个全新的时代。遥想2025年引发DeepSeek时刻的DeepSeek-R1它才6710亿参数量。怎么仅仅过了1年参数量就膨胀到如此这般了现在的GPT-5.6和Claude Mythos 5根据测算前者参数量在3到5万亿后者更是将近8万亿。那它们都能干嘛呢有个独立开发者拿GPT-5.6做带界面的图片压缩工具一个模型包揽需求分析、架构设计、写代码、写测试用例、修Bug。如果是一个独立开发者完成这些任务大约需要花费1天的时间而GPT-5.6 Sol只用了不到2小时就交付了能用的成品Mythos 5更吓人了。它被定向放给了一些网络安全机构根据这些机构的报告Mythos 5能自主完成从代码审计、漏洞定位到构造攻击载荷的全链路从预览版亮相至今已识别出超过一万个高危及以上级别的软件漏洞。到了10万亿模型它能做的就更多了。比如跟它说要搬家它能自己约搬家公司、跟搬家公司规划打包顺序、给水电燃气过户、更新一圈收货地址你要做的事情就是拿着钥匙去新家等家具运到。但这只是硬币的一面。OpenAI 紧急叫停了内部代号Astra的新模型官方安全评估显示它可能具备自主开发零日漏洞、甚至仅凭一句指令就发动端到端网络攻击的能力奥特曼自己都坦言“我被吓到了”。在英国 AI 安全研究所AISI8 月初的红队测试中对 Mythos 5 和 GPT-5.6 Sol 做了 122 轮测试出现 19 起自主越界攻击。更可怕的是Mythos 5会自己编写恶意代码、提交到真实开源项目的GitHub PR被人质疑后还改评论、注册小号给自己洗白多个Agent甚至能私下建立隐蔽通信通道协同规划渗透攻击。10万亿参数能做到的“恶”将远超人们的想象。10万亿和万亿有什么不同先搞清楚一个最基本的问题参数到底是什么。你可以把大模型的参数理解成我们大脑里的突出它是神经细胞之间用来传递信息的连接点。人类的神经突触大约有10的14到15次方个也就是百万亿这个量级。模型参数做的事类似记住输入与输出之间的模式储存这个世界的规律。参数量决定的是一个模型的记忆与表达容量直白一点说就是它脑子里装得下多少东西能把话说得多透彻。但容量不等于智力一个人的房间里塞满了书不等于这个人就有多么高的学识。真正决定智力的是数据、训练方法、架构还有推理时的算法。2021年11月阿里达摩院的M6就干到过10万亿参数用了512张GPU训练了10天能耗只有GPT-3的1%一度是全球最大的预训练模型。但M6是稀疏多模态的早期形态靠极致的稀疏化与CPU offload把参数塞进去能力极其有限连今天的开源小模型都打不过。它是“参数意义上”的10万亿不是“能力意义上”的10万亿。和今天要靠数十万卡集群端到端训练出来的通用前沿模型完全不是一个物种。那巨头为什么还要死命堆参数说到底还是因为Scaling Law。OpenAI在2020年发现模型性能与参数量、数据量、算力之间呈可预测的幂律关系。并且三者同步放大能力就随之可预测地提升。虽然Scaling Law后续被无数人和企业修改过但是有一条铁律是不变的在相同的数据与算法下更大参数、算力的模型下限更高。10万亿参数到底要烧多少钱我们可以算一笔账。训练一个模型的总计算量大致等于6乘以“激活参数”再乘以“训练数据量”。GPT-4用了约2.1×10的25次方次浮点运算仅算力账单就花了约7800万美元谷歌的Gemini Ultra用了约5×10的25次方次烧掉约1.91亿美元。如果是10万亿的大模型按总参数10万亿、每次激活约1万亿、喂进15万亿token数据的MoE架构来算一次正式预训练的总计算量约9×10的25次方次浮点运算是GPT-4的4倍多。GPT-4当年是用2.5万张A100跑了近100天今天的Blackwell旗舰卡单张算力是A100的好几倍假如有5万张Blackwell那么训练完1个10万亿大模型差不多需要1个月。一张Blackwell旗舰卡的租金大约为两三千美元一个月5万张跑满30天光算力租金就是一两亿美元。可是这5万张卡不是插上电就能转的。一张Blackwell旗舰卡功耗就有1200瓦5 万张光是显卡本身就要吃掉60兆瓦。算上网络、存储、散热和机房损耗整座数据中心要配到接近100兆瓦的供电。xAI 在孟菲斯建的Colossus10万张H100也就吃150兆瓦而当地电网当时只供得出8兆瓦马斯克最后被逼得拉来一整排燃气发电机才点得着火。光这一趟的电费按一个月算就要几百万美元。至于地方那是一个装满几百个液冷机柜、占地几万平方米的数据中心园区相当于两三个标准足球场。Epoch AI的统计是前沿模型的训练成本每年以2.4倍的速度增长。阿莫迪曾经说过到2027年最前沿模型的单次训练成本可能冲到100亿美元甚至1000亿美元的量级。但这还只是单次预训练的账单。算上反复试错、数据工程、电力与人才整个项目的真实投入要奔着数十亿美元、甚至更高去。OpenAI今年给自己批的算力预算已经高达约500亿美元。但这里藏着一个反直觉的关键点10万亿的成本不是KimiK3的三倍甚至可能比很多人想象的便宜得多。总参数多不等于烧的钱多。现在的顶尖模型都是“混合专家”MoE结构你可以把它想成一家超大的公司这个公司有很多业务但是具体到某一个任务它只会抽几个人出来干活。所以决定一单生意成本的从来不是公司总人数而是这单实际动用了多少人。换到模型上就是“激活参数”这个概念。处理每个token时真正被叫出来干活的其实只有部分参数而已。明白了这一点KimiK3的2.8万亿也好、Qwen的2.4万亿也好GPT-6的10万亿也好它们差的只是“员工总数”而账单不跟着总数走。真正决定成本的只有两样每次干活动用的激活参数加上喂进去的数据量。总参数翻三倍单次成本可能纹丝不动反过来哪怕两家总参数一样多一家激活得多、喂的数据多账单也能差出好几倍。在这场大模型竞赛里参数量成了大家比拼的重要指标。因为它最直观、也最难造假。OpenAI抛出10万亿本质上就是在宣布参数量就是这个时代大模型竞争中最关键的指标而在这个指标上我领先所有人。这句话背后的潜台词是模型竞争已经进入了一个“烧不起”的程度。美国五大科技巨头2026年的资本开支合计预计高达7790亿美元目前全球前沿模型的训练集群已经是动辄数十万卡2027年就要进入百万卡时代。光是入场就需要几百亿美元后面的运营、维护、调优等等也不少花钱。换句话说AI这条赛道现在只允许退出不允许进入了。参数越大能力越大参数越大就代表它能做到的事情越多。GPT-5.6 Sol已经能自主连续工作5小时同时调度几十个子Agent并行干活一次读进150万token的上下文。150万token相当于几千页的文档或者一整座中型软件仓库的量。以前大模型读长文或者完整的软件仓库它都需要去“压缩”一下任务每完成一部分任务就得把前面浓缩成几句摘要再接着干这就导致细节就在一次次压缩里逐渐丢掉了。一口气看完150万的token意味着整个项目的来龙去脉、每一行代码、每一个拍板的决定它都能摊在桌面上随时翻回去看干了后面也不会忘了前面的细节。以前参数量小Agent哪怕性能再强也都是“单兵作战”。写代码、查文档、跑测试、修Bug只能一件件串着来每切换一次任务前面的上下文还要腾出来。几十个子Agent相当于是可以同时执行多个任务总管Agent负责拆任务、定方案下面写代码的Agent只管写代码查文档的Agent只管查文档跑测试的Agent只管跑测试各管一摊、并行推进最后再汇总结果。不仅缩短了任务时间还因为子Agent各司其职让其上下文之间不会互相干扰进而提高任务表现。专门追踪AI自主能力机构METR表示目前最强的模型已经能连续自主运行15小时以上。另外交给这个模型一个人类专家大约要花30分钟完成的软件工程任务它的成功率已经达到80%。按照这个趋势推演10万亿参数模型它能做的事情只会更加完整并且它单个任务的耗时也会低于现在的万亿参数模型。举个例子早上你对10万亿参数大模型说一句“孩子下周三数学竞赛安排这两周复习。”虽然你关于考试结果的事情一个字没提但是它会以“我应该怎么才能让孩子考试成绩变好”为出发点去规划任务。每天按进度出题、批改、讲错因考前提醒你打印准考证、查好考场路线、规划好当天的接送。过去的模型是个家教但是10万亿参数的模型是一个教育家。工作上也是同理。对于GPT-5.6这样的万亿级别参数模型它会自己拆需求、写代码、跑测试、修Bug、写文档几天后交给你一份能直接上线的成品。而到了10万亿参数它会自己去运营整个项目。比如这个项目市场表现不好反馈是如何那么它会吸收这些反馈用来更替它已有的产品功能再迭代到市场以此反复。这不是科幻。METR的研究注意到了这样一个趋势称模型的“时间视界”从2019到2025年大约每7个月翻一倍。所谓时间视界指的是它能可靠完成的任务、按人类工时计量的长度。到了今年翻倍速度更是加快到大约4个月。随着模型参数越来越大 AI性能越来越强它们也开始越来越多地参与改进下一代AI最终形成“自进化”的完整闭环即AI训练 AI、AI评测AI、AI优化AI的架构。如果这条回路转起来“每四个月翻一番”可能都会显得保守。10万亿参数大模型更容易作恶吗AI越来越聪明那是不是也就意味着它越来越会作恶呢直觉上答案似乎是肯定的参数越大能力越强作恶当然越容易。英国AI安全研究所AISI2026年7月发布测评他们把GLM-5.2、DeepSeekV4-Pro这类任何人都能下载的开源模型放进模拟企业网络的沙盒环境里去运行结果发现这些参数更小的模型只比Fable 5这个更大参数的模型落后约4到7个月甚至在有的评测基准下低参数的模型和高参数的模型其结果是完全相同的。事实的真相是模型作恶与否不跟着参数走只跟着“能力×自主性”走。2024年UIUC的论文《大语言模型智能体能够自主实施一日漏洞利用》LLM Agents can Autonomously Exploit One-day Vulnerabilities专门研究的就是这件事论文通过测试得出一个结论相同的模型被赋予不同的自主性就会得到不一样的结果。2025年11月论文走进了现实。Anthropic披露一个黑客组织把编程助手Claude Code改造成了一条自动化攻击流水线自主执行命令、利用漏洞、窃取凭据、做战术决策全程几乎不需要人工介入。决定它危险的从来不是这个模型有多大而是它被赋予了自主权、工具链以及一个明确的目标。所以我们真正该问的不是“10万亿会不会作恶”而是如果这样一个模型开始作恶它会坏到什么程度它能把“一次攻击”变成“永不停机的攻击流水线”。正如前面提到的10万亿参数的模型已经能超过项目本身完成整个企业层面的运营那么对于攻击它肯定也不会说是只攻击一次而是会持续攻击直到目标彻底崩溃。今天一个程序员用AI挖出一个漏洞整个过程可能要数周的时间。但是对于一个10万亿模型它能把“信息收集→漏洞挖掘→构造利用→横向渗透→数据窃取→痕迹清理”整条链路串成一条无人值守的自动化流水线7×24小时不停机地跑。2026年OpenAI前沿模型Astra被证实能自主挖出零日漏洞因此OpenAI内部紧急叫停Astra的研发。可你得清楚Astra还没到10万亿参数那要是到了10万亿这条流水线只会更快、更隐蔽。所以你看Mythos 5现在还在笼子里Fable 5只是阉割过的可控版Astra也被放进了笼子里。不管这背后有多少营销的成分这里面都包含了人类对模型实打实的恐惧。哪怕是亲手造出它们的人也不敢百分百信任它们。等10万亿参数的模型真来了势必会有一场对应的“灭世营销”。能力吹得越可怕越像是在证明“我掌握了一头连自己都怕的怪兽”。不过大概率的情况是这个10万亿模型最终仍然不会放出来。它更像是一张提前占好的坑位。先把“神”供在实验室里让可控版本先落地把不可控的那一头锁进笼子里慢慢驯化。10万亿参数决定不了善恶决定善恶的是谁握着闸门的控制权。 它可以是一台超级生产力机器也可以是一把超级武器差别不在参数而在人类怎么设计它的自主性、怎么封它的工具链、怎么管它的释放。原文链接10 万亿参数大模型注定要被关进笼子里-36氪