Anthropic在9月23日披露了一项早期生物学实验:Claude在科学家只给出高层目标的情况下,独立完成资料检索、数据分析和候选筛选,找出一个与成簇DNA重复序列相关的酶系统。因为这些重复序列的形态让人联想到CRISPR,消息很容易被包装成“AI发现新CRISPR”。但官方没有这样下结论。更准确的说法是,团队发现了一组此前未被系统描述的候选酶与重复结构,后续仍要靠实验室验证其功能、机制和生物学意义。
这项工作来自Anthropic今年春季启动的生命科学研究计划。计划要回答的问题并不玄乎:通用模型能否把文献阅读、数据库查询、代码分析和假设生成串成一条真正有用的科研流程,而不只是把论文总结得更顺。此次结果是第一批公开案例之一,说明模型已经能在开放问题上缩小搜索空间,但远没有跨过实验验证这道门槛。
真正的新意,是模型自己组织了漫长而杂乱的搜索
生物信息学研究常常不是缺数据,而是数据太多。研究者需要在基因组、蛋白结构、物种分布和既有论文之间来回核对,再判断某个模式究竟是偶然相关,还是值得做湿实验的线索。Claude在这项任务中承担的角色,更像一个不知疲倦的计算研究员:它先拆解问题,再选择工具,写分析代码,检查中间结果,并根据异常继续追踪。
Anthropic强调,科学家提供的是高层方向而非逐步操作说明。这个细节很关键。如果每一步都由人设计,模型只是更快的脚本生成器;当模型能够自己决定查什么、比较什么、放弃什么,它才开始影响科研流程本身。不过“自主”也不等于无人监督。研究问题、数据范围、可用工具和最终判断仍由人类团队负责,模型找到的候选还必须接受独立复核。
这类任务也暴露了AI科研最难评价的地方。聊天机器人答对一道题,可以用标准答案打分;开放式发现没有现成答案,成功往往依赖是否找到了一个此前没人重视、又能被实验检验的方向。模型产生十万个听上去合理的假设没有价值,能把候选压缩到实验室愿意投入时间的少数几个,才算真正节省科研成本。
因此,这次案例最值得关注的指标并非模型写了多少代码,而是线索的“可验证性”。候选序列能否在独立数据集中复现,相关酶是否具有预测中的活性,重复结构是否参与防御、调控或其他机制,都需要后续实验回答。任何一个环节失败,都可能把漂亮的计算故事变成一次普通的假阳性。
从候选线索到生物学结论,中间还有一整条证据链
CRISPR之所以改变生物技术,是因为研究者不仅观察到特殊重复序列,还逐步证明了其免疫功能、分子机制和可编程性。Anthropic此次披露的系统目前只处在更靠前的位置。把“形态类似”写成“功能相同”,或把“候选发现”写成“新基因编辑工具”,都会夸大现有证据。
现实的下一步包括重新跑分析、排除数据库注释错误、检查物种和样本偏差,随后设计表达、结合或切割实验。即使实验确认了活性,也还要判断它是否稳定、是否具有选择性、是否能在不同细胞环境工作。能进入医疗或工业应用的分子系统,更要经过安全性、可制造性和监管评估。今天的公告没有给出这些结论。
但谨慎不代表这项结果不重要。基础研究最昂贵的部分之一,是在巨大可能空间里决定先做哪一个实验。若通用模型能持续给出高质量、可复现的候选,它可能提高实验设备和研究人员的利用率。AI不会替代移液枪,也不能替代对异常结果的科学判断,却可能改变实验开始前的准备方式。
对研究机构来说,现在更合理的部署方式是“模型提议、流水线复核、实验裁决”。模型的搜索日志、代码版本和数据来源应完整保留;关键结论需要由另一套方法重复;阴性结果也要记录,防止团队只展示成功案例。只有把失败率一起公开,外界才能判断这是可复制的研究能力,还是一次幸运命中。
Anthropic还需要回答规模化问题:一次案例能否迁移到别的蛋白家族,模型对训练数据中已有但不显眼的线索依赖多大,不同模型或提示能否得出相近候选。若这些测试成立,AI在生命科学里的价值会从“帮研究者写东西”转向“帮研究者决定下一步做什么”。眼下最合适的判断仍是:一个值得认真验证的早期成果,而不是已经完成的生物学突破。












