行业资讯
📅 2026/8/29 14:30:26
超越AlphaFold:AI生物建模从预测结构到生成系统
AlphaFold已经在结构生物学领域确立了自己的位置但真正值得关注的往往不是已有结论而是那些超越结论的新信号。最近又有一家AI公司宣布完成新一轮融资金额达到1亿美元级别对外释放的核心观点非常直接AlphaFold不是生物世界天花板。这句话听起来很像营销话术尤其是放在“又融了一亿美金”的背景里。但如果你把视线从“预测蛋白质结构”挪到“理解生命系统”就会发现这个观点不是完全没有道理。AlphaFold解决的是蛋白质三维结构预测这是一个困扰生物学几十年的难题但结构只是生物世界很多拼图中的一小块。一个蛋白质在细胞里处于什么浓度、什么时候发生修饰、和谁结合、受哪些信号调控、产生什么下游反应这些才是生命过程的关键。换句话说AlphaFold提供给你的是一张静态结构照片而真实生物系统本质上是一部多线程、多角色、动态交互的长视频。这篇文章不打算简单评价哪家公司、哪个口号正确而是想借这个现象把三件事拆清楚AlphaFold的真正贡献和边界在哪里新一代AI生物建模和AlphaFold的路线差异在什么地方以及大额融资背后技术拐点和泡沫成分分别有多少。如果你正在关注AI在生命科学领域的应用或者正在考虑要不要进入AI for Science这篇文章会给你一个比较实际的认知地图。1. 先搞清楚AlphaFold真正的贡献不是“预测结构”本身1.1 它把科学问题变成了可计算问题AlphaFold最大的贡献是所有使用者都能感知到的它让蛋白质结构预测从实验室里漫长的试错变成了一种计算任务。过去要获得一个蛋白质的高分辨率结构往往要做基因克隆、蛋白表达、纯化、结晶再用X射线晶体学或冷冻电镜收集数据。这个过程不仅需要昂贵设备还经常卡在“这个蛋白就是不长晶体”这种问题上。几个月甚至几年拿不到一个结构在结构生物学里很常见。AlphaFold改变了这个流程。它利用多序列比对里的进化信息结合注意力机制直接预测每个残基的空间位置和置信度。从外行的角度看输入是一条氨基酸序列输出是一套结构坐标。但从科研方法论的层面看这代表一个更重要的变化过去依赖物理实验的难题被重新定义成了一个可以建模、可以优化、可以自动评估的计算问题。这个转变的价值比结构预测准确率本身更值得重视。因为这意味着只要能把生物学问题翻译成适合神经网络处理的形式就有机会用AI加速。1.2 AlphaFold做不到的几件事但AlphaFold的价值边界也很清楚。它解决的是“序列到静态结构”的映射而生物学需要的远不止这些东西。蛋白质是动态的。很多蛋白质在发挥功能时会经历构象变化比如蛋白激酶的活化、通道蛋白的开闭。AlphaFold输出的是某一个相对稳定的构象而不是构象变化的路径和能量分布。蛋白质不是孤立存在的。它在细胞里会结合其他蛋白质、核酸、小分子、膜环境结构与功能高度依赖上下文。AlphaFold对单链结构的预测很出色但对复合物、尤其对动态复合物的建模仍然不够全面。结构不等于功能。知道一个蛋白质长什么样不等于知道它在代谢通路里催化哪一步、在信号转导中和谁传递信号、在疾病状态下发生了什么改变。实验证据仍然不可替代。AlphaFold预测的结构可以作为假设来源但在药物研发、突变致病性判断中通常还需要实验来验证。这些边界并不是AlphaFold的缺陷而是问题定义本身就有限。它聚焦的是“这一条序列的折叠形态”而不是“这一个蛋白在细胞里的完整故事”。1.3 为什么“结构地图”不等于“生物世界”我经常用一个类比来理解这件事AlphaFold给出的空间结构相当于一张地图。地图能告诉你一栋楼的位置、轮廓和周边道路但地图无法告诉你此刻这栋楼里的人正在聊什么、哪里交通拥堵、哪个区域正在施工、哪条路因为突发事件被临时管制。生物世界也是类似。蛋白质结构是生命运转的基础单元但是真正决定一个生物体状态的是无数分子在时间和空间上的协同作用。我们可以把AlphaFold理解为“生物认知的第一张高精度地图”它极其重要但它没有回答“系统如何运转”这个更深的问题。这也是“AlphaFold不是天花板”这句话的立足点它不是否定已有成就而是指出下一个需要攻克的问题层次。2. 为什么新的AI公司敢挑战“天花板”核心是任务定义变了2.1 从“预测结构”到“理解与生成系统”AlphaFold的任务定义非常清晰序列进结构出。这是一个判别式的预测任务。而这一轮新兴AI生物公司的路线明显更接近“生成式”和“系统性”。它们要做的往往不是预测某一个静态属性而是尝试生成可用的蛋白质序列、模拟细胞状态变化、预测基因扰动后系统会怎么走。举个例子蛋白质设计。AlphaFold能帮你验证一段序列折叠成什么样子但要设计一个具有特定功能、稳定可表达、并且能在细胞里正确行使功能的蛋白质你需要的不只是结构预测器而是一个生成模型加一套功能评估器。你希望从“给定序列预测结构”变成“给定功能要求生成序列”。这是从“读懂结构”到“写出生命语言”的跨越。2.2 大模型和扩散模型让这种任务第一次可行为什么过去做不了这样的系统级建模最直接的原因是数据、算力和模型架构都不够。生物数据不是没有而是高度分散。单细胞测序、空间转录组、蛋白质组、代谢组、活细胞成像每一种数据都来自不同平台有不同的批次效应很难统一。算力成本极高。一个基因组级或细胞级模型训练代价远高于语言模型需要大量GPU资源和工程优化。模型能力不够。早期神经网络很难处理生物系统里的图结构、时空依赖和多尺度耦合。但过去几年AI方法本身发生了很大变化。预训练模型学会了从海量序列里学习进化规律扩散模型可以生成高质量的三维结构图神经网络可以建模分子之间的复杂关系多模态对齐可以把文本、序列、结构、图像放到同一个表示空间里。这些技术虽然很多是从自然语言处理或计算机视觉迁移过来的但一旦适配到生物数据上就打开了新的可能性。更值得注意的是AlphaFold本身也在迭代。后续版本把蛋白-核酸复合物、配体、修饰等都纳入了预测范围说明顶尖团队也在努力拓展边界。但即使如此这套以结构为中心的框架依然没有直接回答“细胞如何决策”“系统如何响应扰动”这类动态问题。新一代模型要补的正是这一大块空白。2.3 和AlphaFold的本质区别建模对象和输出形式一张表格可以更清楚地说明这种差异维度AlphaFold为代表的经典路线新一代AI生物模型建模对象蛋白质静态结构蛋白质功能、细胞状态、多分子系统输入氨基酸序列序列、结构、表达谱、扰动、环境条件输出三维坐标和置信度生成序列、状态预测、效应评估任务类型判别式预测生成、模拟、设计验证方式与实验结构对比湿实验验证、功能实验领域范围结构生物学药物研发、合成生物学、精准医学成熟度较成熟早期科研阶段当然这个划分不是绝对的。很多新兴模型仍然会把AlphaFold作为子模块使用。更准确地说新的AI生物模型不是要替换AlphaFold而是把它吸收进更大的系统里在上面叠加功能预测和生成设计。这也解释了为什么这些公司需要大额融资它们做的不是单点算法优化而是数据、模型、算力、湿实验验证的完整基础设施。这个盘子比AlphaFold当年要大得多。3. 真正可能改变产业的是“设计”而不是“预测”3.1 从“猜结构”到“造蛋白质”AlphaFold告诉科研人员“这个蛋白质长这样”但很多产业场景真正关心的是“我需要一个能特异性结合某个靶点的蛋白能不能帮我造出来”。这是典型的逆向设计任务。过去蛋白质工程主要靠随机突变加上高通量筛选相当于在一大堆钥匙里找一把能打开特定锁的钥匙效率低且经常找不到。AI生成模型则可以先学习蛋白质序列和功能之间的规律再生成一批候选序列经过计算筛选和实验验证把有效的候选保留下来继续迭代。这种方式不是完全不需要实验而是把实验资源集中在更可能成功的候选上。在抗体发现、酶改造、疫苗抗原设计等领域这种“生成-筛选-验证”闭环已经开始被采用。它最大的变化不是“快”而是把过去依赖经验和运气的探索过程变成了一条可计算、可重复、可持续优化的流程。3.2 从单个蛋白质到多分子系统蛋白质设计只是第一步。真正的生物功能很少由单一分子独立完成。细胞内的信号通路、代谢网络、基因调控回路都有大量分子参与。新一代AI模型的目标是要理解这些分子之间的规则。比如如果你敲除某个基因细胞整体的基因表达会发生什么变化如果一个药物分子结合到某个受体上下游信号通路会产生多大程度的激活或抑制这种问题本质上已经超出结构预测的范围进入系统建模的领域。这类模型一旦成熟在疾病机制研究和药物开发中会非常有用。它可以先做大量的“虚拟扰动实验”在计算机里筛选更可能有效的靶点或药物组合再进入真实实验。这能够显著压缩药物研发早期阶段的试错成本。3.3 从科研工具变成工业基础设施很多技术从实验室走向工业靠的不是论文里的惊艳指标而是能不能稳定、低成本地解决真实流程里的问题。AI生物模型正在经历这个过程。药物研发最典型的痛点之一是候选分子失败率高。AI模型如果能在早期就把具有毒性或脱靶风险的候选剔除掉哪怕只提高几个百分点的成功率对成本的影响都是巨大的。合成生物学也需要设计大量天然不存在的酶和代谢通路AI生成设计可能是唯一可行的探索方式。所以大额资本押注的并不是一个“更好的AlphaFold”而是一种新的生物研发基础设施。这种基础设施由三块拼图组成高质量的数据、强大的生成模型、以及能够验证假说的湿实验平台。只做算法没有数据闭环很难形成真正的护城河只做湿实验没有计算设计又会陷入传统研发的高成本模式。单次跑通不等于可以稳定批量使用这句话在AI生物模型里同样适用。示例效果很好和能进入生产环境中间隔着大量工程细节。4. 别被口号带节奏AI生物模型落地还要过四道坎大额融资容易让人产生一种错觉技术已经成熟了。但如果真的要在实际项目里用还有几个绕不开的问题。4.1 数据稀疏、异构、有噪声生物数据的第一个问题是稀疏。人类已知的蛋白质序列有几亿条但拥有实验确定功能注释的蛋白质只是其中很小一部分。你想训练一个模型理解蛋白质功能标签量远远不够。第二个问题是异构。单细胞数据、空间组学、活细胞影像、质谱数据格式完全不同测量误差和批次效应也很大。把不同来源的数据放在一起训练往往会出现“学到的不是生物学而是实验批次”的问题。这需要大量数据处理和标准化工作远不是一个模型架构能解决的。第三个问题是标注成本高。图像有成熟的数据集文字有大量网页但生物数据的标注通常需要真实实验。这决定了AI生物模型很难像大语言模型那样靠无监督数据无限扩展。4.2 评估没有一个统一的“生物版基准”AlphaFold之所以进展顺利是因为结构生物学有一个公认的评估标准拿预测结构和实验结构对比LDDT、TM-score一目了然。但到了“预测细胞状态”“设计一个功能蛋白”这个层面评估标准变得很难定义。你怎么判断一个AI生成的新蛋白“有效”最终还是要到湿实验里去测活性、表达量、稳定性、特异性。这导致不同模型之间的比较很难做一个模型在论文里表现好可能在另一个实验室的体系里完全不好用。所以在看任何AI生物模型时都要先问一句它的核心指标是在什么数据集上测的有没有独立的第三方验证有没有经过真实的湿实验闭环如果这些答案含糊宣传再漂亮也要打折扣。4.3 算力系统级模型的训练门槛不低训练一个蛋白质结构预测模型普通实验室已经比较吃力。训练一个细胞级或基因组级模型成本会再上几个量级。这还没有算上把模型部署到实际项目里的推理成本以及反复迭代需要的工程团队。如果一家公司声称要做“全细胞模拟”但连数据处理和模型训练的工程能力都不具备那基本就是讲故事。反过来看大额融资对这个赛道很重要因为没有足够的资金根本撑不起从数据到模型再到实验验证的闭环。4.4 湿实验闭环模型不能单独成立AI模型给出的预测或设计结果最终必须经过实验验证。这种验证不只是“看是否有效”还要看是否稳定、可重复、可放大。一个常见的坑是模型在公开数据集上训练评估时又用同类数据容易出现数据泄漏造成的虚高。更稳妥的做法是把湿实验作为闭环的一环AI设计一批候选实验筛选把实验结果反馈回模型再迭代下一轮。这才能形成持续改进的数据飞轮。如果没有湿实验能力AI生物模型很难长期保持竞争力。评估一个AI生物模型不能只看论文里的指标要看它在独立数据集和真实实验中的表现。失败案例往往比刷榜分数更有信息量。4.5 一个可以复用的排查思路如果你想在实际项目里引入AI生物模型可以按下面的顺序检查先明确任务你要的是结构预测、蛋白质设计还是系统行为预测不同任务对应完全不同的模型。再看输入数据你的数据格式、规模、质量是否匹配模型要求有没有做好去重、标准化和批次校正再检查验证方式模型在哪个测试集上评估评估指标和你的真实目标是否一致接着看失败案例模型在什么情况下会失效有没有不确定性估计能不能给出置信度最后规划实验验证哪些预测结果需要湿实验确认反馈周期是多久能不能形成闭环这套排查思路很朴素但在这类新领域反而是最容易被忽略的。5. 大额融资和“天花板”论对不同人意味着什么5.1 对生物和医药背景的人工具逻辑变了过去使用AI工具通常是“找一个在线预测网站输入序列下载结果”。但下一阶段更可能是“在自己的项目里调用模型API或基于开源模型做微调完成一个流程化的设计任务”。这意味着你不需要成为机器学习专家但需要理解模型能做什么、不能做什么。从实用角度看可以先从单一任务切入比如用成熟模型做抗体可开发性预测或用蛋白质设计工具生成候选序列逐步把AI融入到现有实验流程中。不要一次性推翻现有方法也不要完全依赖模型输出。5.2 对AI工程师和算法背景的人门槛在领域知识AI for Science听起来很性感但真正难的不只是模型结构。你需要理解生物学问题的本质、数据的来源和限制、评估指标的合理选择。如果没有生物学背景最好的切入方式是和领域专家合作或者选择一个垂直小问题把数据处理做到极致。从模型层面看Transformer和扩散模型并不是银弹针对生物数据的结构进行定制往往比堆参数更重要。5.3 对投资和决策者分清技术拐点和故事泡沫“融了1亿美元”本身不代表技术成立。看这类公司更值得关注的是它是否同时具备数据、模型、湿实验验证三块拼图有没有在真实客户或真实管线里产生可验证的改进而不是只发布了一篇论文或一个刷榜分数。技术拐点的特征是某个原本又慢又贵又随机的过程第一次变得可计算、可复用、可扩展。泡沫的特征是口号宏大但离验证闭环还很远只能不断讲新概念。AlphaFold说自己是结构预测的天花板并不是错真正重要的是谁能在下一个问题层次上做出可验证的成果。适合场景不适合场景有湿实验平台能形成数据反馈闭环只有算法团队没有实验验证能力垂直领域有多年数据积累没有高质量数据指望模型自动学出来愿意长期投入基础设施只想快速发表论文、拿融资问题定义清晰比如抗体验证、酶改造目标过于宏大比如“全细胞模拟”但资源有限5.4 给普通开发者和科研人员的下一步建议如果你想在2025年之后真正进入这个领域建议从下面几个方向里选一个选择一个公开可用的蛋白质相关模型跑一遍结构预测或蛋白质设计任务熟悉输入输出格式。找一套公开的湿实验验证数据看模型在独立测试集上的表现而不是只看作者自己给的指标。和做实验的人合作把一个10到100个候选的小规模设计实验走完理解误差和不确定性来自哪里。关注数据工程学会处理单细胞、质谱、序列比对等数据这往往是比模型更稀缺的能力。不要急着训练自己的大模型先基于现有开源模型做下游任务验证“模型数据”组合是否能在真实问题上生效。这些建议不新但放在AI生物这个方向上恰恰是最能区分“看热闹”和“真正动手”的分水岭。最后说一句AlphaFold是不是生物世界的天花板其实不重要。重要的是这个问题背后揭示了一个趋势AI在生命科学里的角色正在从“单点工具”变成“系统级基础设施”。预测结构只是起点真正难的是让AI理解蛋白质、细胞、多组学在一起如何运转并能够生成我们可以使用的生物分子和细胞状态。回到那句话如果你看到一个AI公司说AlphaFold不是天花板不用急着嘲讽它也不用急着相信它。你要看它的任务定义是否真的比AlphaFold前置了一步有没有数据支撑有没有湿实验闭环。科学领域的天花板从来不是被口号打破的而是被更准确的问题、更完整的模型和更扎实的验证逐步推高的。