7月31日注定是 AI API 市场值得记住的一天OpenAI 宣布 GPT-5.6 Luna 降价 80%DeepSeek V4-Flash 正式版上线且 Agent 能力暴涨 6 倍MiniMax 开源视频模型 H3 登顶全球榜单字节跳动发布 Seedance 2.5……一天之内中美大模型厂商集体出牌。这不是普通的促销而是 AI API 价格战进入终局的信号——当模型智力达到及格线竞争的核心已经从谁更聪明变成了谁的推理成本更低。一、一天之内行业格局被改写OpenAI第一次被逼到地板价7月30日OpenAI 在社交平台 X 上宣布下调 GPT-5.6 系列部分模型 API 价格模型 定位 输入价美元/百万Token 输出价美元/百万Token 降幅Luna 最快、最经济 0.20 1.20 -80%Terra 日常平衡 2.00 12.00 -20%Sol 旗舰 5.00 30.00 不变新增Fast模式其中 Luna 堪称一手大跳水输入价 0.20 美元/百万 Token已经和上一代 GPT-5.4 nano 持平输出价甚至便宜 0.05 美元。但 Luna 干的活远不止分类、抽取这类简单任务——它被定位为面向成本敏感型工作负载的模型可以调用工具、处理长上下文、执行多步工作流。换句话说OpenAI 正在把支撑 Agent 干活的模型卖到过去小模型的价位。同时Sol 新增 Fast 模式速度提升最高 2.5 倍价格翻倍智能水平不变。Altman 的原话是在每个层级提供最佳的价格与智力性价比。 分层定价的意图昭然若揭。DeepSeekV4-Flash 正式版Agent 能力暴涨 6 倍同一天DeepSeek V4-Flash 正式版上线公测价格依然是斩杀线级别- 输入·缓存命中**0.02 元/百万 Token**- 输入·缓存未命中1 元/百万 Token- 输出**2 元/百万 Token**约 0.28 美元这是什么概念输出价约 0.28 美元而 Anthropic Claude Opus 4.8 的输出价是 25 美元——**DeepSeek V4-Flash 的价格只有 Claude 的 1/90**。更关键的是能力正式版在 Agent 能力上大幅增强通过后训练实现性能 6 倍提升相对 V4-Pro Preview。官方还推出了自研 Agent 测试框架 **DeepSeek Harness**帮助开发者验证模型在多步骤任务、自主规划、工具调用等场景的真实能力。有开发者的实测很能说明问题用官方 API 接入 Claude Code 干活不到 4 小时消耗约 1 亿 Token缓存命中率高达 99%干活质量还不错很少返工。另一位用户更直接一遍写完真实测试一遍完美通过顺手修了十几个 bugopencode 只花了 0.1 美元。还有两记重拳- MiniMax正式发布首款开源多模态生成模型 H3视频编辑能力排名全球第一价格仅为同类旗舰的三分之一- 字节跳动发布新一代视频生成模型 Seedance 2.5。一天之内文本、Agent、视频三条赛道同时降价/提质**模型能力提升伴随 Token 降价正在成为行业新常态**。二、降价背后的真实账本谁在赚钱真实成本对比降价后 DeepSeek 仍比 Luna 便宜 60%表面看Luna 降价 80% 后输入价 0.20 美元比 DeepSeek 未命中价1 元≈0.14 美元还便宜。但开发者算的是单任务总成本 即便降价后DeepSeek V4 Flash 的单任务成本仍比 Luna 低约 60%。关键原因在于 DeepSeek 凭借 **98% 的缓存命中折扣** 和 **MoE 架构**把推理成本压缩到极致。缓存命中输入价 0.02 元 vs 未命中 1 元——**50 倍价差**。在生产环境中稳定前缀系统提示词、工具定义、文档模板的缓存命中率可以做到 90% 以上实际输入成本几乎可以忽略。性能只差 1 分降价后开发者会回流吗在 Artificial Analysis 智能指数中- DeepSeek V4 Flash**50 分**- GPT-5.6 Luna**51 分**仅差 1 分实际使用体验几乎持平。在 Terminal Bench终端智能体基准上 DeepSeek 得分 82.7速度甚至更快——同一任务 GPT 旗舰用时 1 分 47 秒DeepSeek 更快完成。**1 分的差距不足以让已经习惯国产模型的开发者回流 OpenAI。** 这正是 OpenAI 降价逻辑里的无奈不是想降价而是不得不降。OpenAI 的防御逻辑Luna 的 Intelligence Index 跑分已逼近 Opus 5——**曾代表行业巅峰的智力水平现在以白菜价大规模供应**。这背后的底层逻辑是 当模型智力达到知识工作者的及格线后竞争核心已从谁更聪明转向谁的推理成本更低。价格战打到现在**API 单价已经不再是护城河生态、工具链、落地场景才是。**三、对开发者最好的时代也是最需要精打细算的时代好处是实实在在的- **API 成本压到几乎可以忽略**有用户充值 100 元至今花费不到几元直言价格当电费用- **AI Agent 可以 7×24 小时跑**过去因为算力太贵不敢想的场景全天候代码审查、自动运维、批量内容生产现在都能放手去试- **学生、个人开发者真正进入 AI 应用层**每月几千元的 Token 账单变成几块钱AI 不再是少数人的工具。但无脑调用的时代结束了价格战之下**选对模型和算对成本同样重要**1. **吃满缓存命中价**把系统提示词、工具定义做成稳定前缀输入成本可降一个数量级。这是 DeepSeek 敢卖 0.02 元的底气也是开发者省钱的必修课。2. **分层使用模型**简单高频任务走 Luna/V4-Flash复杂推理走旗舰。同任务成本差异可达 100 倍以上用错档位就是浪费。3. **用 API 网关统一路由**多厂商接入按质量-价格-时段动态路由——高峰切低价通道、低谷切高性能通道。单一厂商的计价规则越复杂调度成本越高网关是控制成本的新护城河。4. **监控有效 Token 成本**一个需要反复重试 3 次的模型实际成本是标价的 3 倍。POC 阶段就把有效成本算清楚。## 四、行业信号AI 投资重心正在从算力转向应用多家机构指出**开闭源双线降价将加速 AI 应用侧落地AI 主线投资重心有望从算力基础设施向应用方向倾斜**具备场景与数据优势的应用厂商将率先受益。这背后的逻辑链条很清晰- 算力产能持续投放 → Token 价格下行 → 应用成本骤降 → 应用创新爆发 → 算力需求再增长更高效地增长**AI 应用商业化拐点已至**——创业板软件 ETF 强势领涨市场已经在用脚投票。五、结语廉价的智能才刚刚开始免费的狂欢渐行渐远但**廉价的智能才刚刚开始**。对开发者来说这是最好的时代模型智力达到及格线、价格打到地板、工具链空前成熟。接下来的竞争不再是谁的模型更聪明而是——- **谁能把推理成本压到最低**缓存、MoE、路由- **谁能把 Agent 跑得最稳**工具链、评测、可观测性- **谁能在应用场景里真正落地**场景、数据、体验2026 年 8 月AI API 价格战进入终局。但终局不是结束而是**新战场的开始**。本文基于 OpenAI 官方公告、DeepSeek 官方信息及公开报道整理36氪、华尔街见闻、新浪财经、财联社、鉅亨網等数据截至 2026 年 8 月 5 日。首发于 api-aiapi.cn 团队博客。