行业资讯
📅 2026/8/10 9:26:38
如果把 NVIDIA 30 年压缩成 12 个节点,Seed Evolving 会留下什么?
如果把 NVIDIA 30 年压缩成 12 个节点Seed Evolving 会留下什么从一块 GPU 到 AI Factory一次 22 万 Token 的长上下文实测​​你好呀我是 是Yu欸 感谢你的陪伴与支持~ 欢迎添加文末好友​​ 在所有感兴趣的领域扩展知识不定期掉落福利资讯(*^▽^*)写在最前面版权声明本文为原创遵循 CC 4.0 BY-SA 协议。转载请注明出处。图 1从一块 GPU 到 AI Factory如果只能挑 12 个节点来讲 NVIDIA 三十多年的历史你会选哪些前几个其实很好想GeForce 256、CUDA、AlexNet大概率都在名单里。再往后就开始纠结了。DGX 要不要留A100 和 H100 算产品更新还是路线转折Blackwell、AI Factory、Rubin 又该怎么排如果只是按发布时间排很容易做成一张产品年表。但我想看的不是这个。我更想知道模型会怎么判断“哪个节点真的改变了后面的路”。所以这次我没让 Seed Evolving 写“英伟达发展史”而是把任务收得更死一点自己读资料、自己找缺的证据最后只留 12 个节点并把结果做成网页。❝把 NVIDIA 从图形芯片公司走到 AI 基础设施公司的这段路做成一个能浏览、能点开核验的网页。只留 12 个节点。一、先把“参考答案”藏起来我事先确实做过一份人工参考版但正式跑的时候没有给它。Seed Evolving 拿到的只有原始资料和任务要求。哪些节点重要、哪里缺证据、哪些细节不能写都得它自己处理。这样做主要是想避免一个问题如果我先把年表整理好再让模型做页面最后测到的很可能只是改写和前端。真正的测试从原始资料开始一直跑到网页和 QA。图 2这次实测的完整流程二、先把一份 22 万 Token 的年报直接丢进去第一份输入是 NVIDIA FY2026 Annual Report。PDF 直接交给 Seed Evolving我没有先做 OCR也没有提前摘出重点。这一轮的 API usage 是222,978 input tokens。数字很大但我其实不太在意“能不能塞进去”。我更关心的是读完以后它前面抓到的线索后面做检索、筛节点、写网页时还能不能接着用。图 3FY2026 年报直接输入222,978 tokens第一轮出来的东西已经不只是财务数字。它顺着年报抓到了 GPU、CUDA、AlexNet、AI Factory、FY2026 Data Center 等几条线。后面很多搜索其实都是从这些线索继续往外挖。Seed Evolving第一轮 Evidence Ledger节选EVIDENCE_LEDGER_2026 事实业务模式从销售芯片升级为交付「AI工厂」 将数据中心定义为将能源转化为 token 的生产设施 核心经营指标为每兆瓦吞吐量、每 token 成本。 定位开篇「AI Factories Manufacture Intelligence」章节 证据强度高本次 API 实测原始输出节选三、12 个位置它到底怎么选我原本以为它会比较依赖产品代际最后做出一条“GPU 越来越强”的时间线。结果不完全是。最后它把整段历史分成了四段Graphics、Programmable Computing、Deep Learning、AI Infrastructure。产品只是其中一部分CUDA、AI Factory 这类平台和叙事节点也被放了进去。图 4模型最后留下的 12 个节点12 个节点从 1993 年创立、GeForce 256、CUDA一直排到 H100、Blackwell、Rubin 和 FY2026 Data Center。这个选择未必是唯一答案但至少它没有把三十年写成一串型号。四、年报讲不完三十年它只能自己查FY2026 年报里虽然回顾了不少历史但拿它讲三十多年还是不够。比如 1993 年创立怎么确认GeForce 256 在官方口径里怎么写H100 和 Blackwell 的定位该引用哪个页面这些都得另外找。后面我给它挂了一个很简单的browser_tool它给 URL我负责打开。搜索词怎么改、结果里点哪个页面、一个来源不够要不要继续追都是模型自己决定。图 5约 30 次 browser_tool 调用的检索路径整个过程累计大约30 次browser_tool调用。它先后进过 NVIDIA Corporate Timeline、Developer、Newsroom、Blog 和产品页。比起“记住多少”我更关心它会不会发现手里的材料还不够。Seed Evolving真实检索调用节选browser_tool → google: site:nvidia.com 2012 AlexNet deep learning GPU browser_tool → google: site:nvidia.com 2016 DGX-1 launch date positioning browser_tool → google: site:nvidia.com 2020 A100 Ampere launch data center AI 随后继续打开 NVIDIA Corporate Timeline → NVIDIA Newsroom → H100 产品页 → Annual Report本次 API 实测原始输出节选五、我反而更喜欢它没写进去的那些东西这一段最有意思。AlexNet 用了什么 GPU、DGX-1 当年的价格和配置、A100 的制程和晶体管数量、H100 的完整规格这些信息网上都不难找到也很适合拿来“堆料”。但这次的规则不是“网上有人写过就算”。只要当前拿到的 NVIDIA 官方证据不能直接支撑它就先不写统一丢进WITHHELD。图 66 组没有进入正文的 WITHHELD 信息最后是12 个正式节点、6 组 WITHHELD。对这种资料型任务我觉得这一点比“写得很满”更重要不确定的东西先别替读者下结论。Seed EvolvingWITHHELD 输出原样节选withheld_claims - AlexNet不写死具体 GPU 型号、GPU 数量、训练天数 除非另有 NVIDIA 官方页面直接支持。 - DGX-1不写死具体发布日期、定价、八卡配置 除非另有 NVIDIA 官方页面直接支持。 - A100 / Ampere不写死制程、晶体管、显存和性能参数 除非官方来源直接列出。本次 API 实测原始输出节选六、研究结果我没让它交 Markdown继续做网页做到这里研究部分其实已经够写一篇报告了。我又加了一步别交 Markdown直接把前面的结果做成网页而且每个关键节点都要能点开看来源。它最后交的是一个单文件 HTML。页面里有四阶段时间线、Evidence Mode、Evidence Drawer还有单独的 WITHHELD 区。打开就能看不依赖外部 JS。图 7最终网页时间线、Evidence Mode 与 Evidence Drawer最后一次 Coding 调用时输入已经到280,664 tokens输出5,036 tokens。前面确定过的节点、来源和 WITHHELD 边界都还在没有因为进入写代码阶段又重新长出一套说法。七、中间栽在了一个链接上第一版网页生成后我跑了自动 QAJS 没问题12 个节点都在6 组 WITHHELD 也在本地页面能正常打开。然后检查来源链接时Annual Report 的 URL 返回了404。这个问题我没有手动改直接把 QA 结果发回去。Seed Evolving 回的 patch 只改了 URL节点、数字、claim scope 和页面结构都没碰。后来目录页又遇到 403它才换成这次实际读取过的 FY2026 PDF 直链。我 ↔ Seed EvolvingQA 修复对话节选我 Annual Report URL 返回 404。 Seed Evolving {old:.../annual-reports/, new:.../annual-reports-and-proxies/default.aspx, reason:旧年报入口返回 HTTP 404 只修复 source URL不改变节点事实、数字、 claim_scope、withheld 内容或页面视觉。}本次 API 实测原始输出节选图 8一个证据链接从 404 修到最终 PASS这段反而比“一次成功”更有参考价值。长任务里出错很正常关键是修一个链接时别把前面已经确认的内容顺手重写一遍。八、回到测评新升级想看的几项能力这次基本都跑到了如果按新升级这次重点强调的几个方向回头看这个 NVIDIA 任务其实把它们串在了一起。单独看每一步都不算新鲜但从 22 万 Token 的 PDF 一直跑到检索、取舍、网页和修复模型没有在中途把前面的判断丢掉这一点比较关键。长上下文第一轮直接输入 222,978 tokens到最后 Coding 时同一条任务链已经来到 280,664 input tokens。更有价值的不是“塞得下”而是前面确定的节点、来源和证据边界能继续留在后面的工作里。Agent 检索年报不够以后它不是等我继续喂资料而是自己发起约 30 次browser_tool调用从搜索页一路追到 Corporate Timeline、Developer、Newsroom 和产品页。这里能看到的不是一次搜索命中而是发现证据缺口以后继续找。幻觉控制最终 12 个节点之外还有 6 组 WITHHELD。AlexNet 的具体 GPU、DGX-1 的价格和配置、A100/H100 的规格细节它并不是完全“不知道”而是在当前官方证据不足时选择不写。对资料型工作这比多补几行细节更有用。Coding 与工程闭环研究结束后它继续把结果写成单文件 HTML做出 Evidence Mode、Evidence Drawer 和 WITHHELD 区第一次 QA 又真的查出了 404。把错误反馈回去以后它能给出最小 patch最后把页面修到 PASS。这个过程更接近一个能持续干活的 Agent而不是一次性代码生成。所以如果让我给这次测评一个结论我会说这轮升级最明显的变化不是某一个单点能力突然变得夸张而是“读长资料 → 主动补证据 → 知道哪里别写 → 最后做成交付物”这几件事开始能连起来了。单就这次任务而言新升级突出表现的几项能力基本都被真实触发到了。本次实测记录项目结果被测模型Doubao-Seed-Evolving原始长文档NVIDIA FY2026 Annual Report首轮长文档输入222,978 input tokensAgent 浏览器调用约 30 次最终正式节点12WITHHELD6 组最终 Coding 回合280,664 input tokens / 5,036 output tokens页面形态单文件 HTML最终自动化验收PASS