Anthropic、OpenAI同一天落子AI4S赛道,巨头混战从「拼模型」转向「卡生态」
6月30日,Anthropic和OpenAI同时在AI4S赛道投下了各自的筹码。 Anthropic发布了科研智能体工作台Claude Science,明确表态“不依赖新模型”,通过工作流整合现有能力来承包科学家的日常研究流程。 OpenAI推出了GeneBench-Pro,一套覆盖基因组学、定量生物学等10个领域的评测基准,其测试数据显示,在129个真实科研workflow题目中,即便是最强的GPT-5.6 Sol,端到端通过率也只有28.7%。 两家巨头的方向看似不同,但都是基于同一个判断:AI4S的瓶颈已不是模型不够强,而是模型远未做到真正的端到端。 基于这一共识,Anthropic的选择是把现有模型装进可扩展的工作台,用工具链和流程弥补模型的不可靠;OpenAI的选择则是抢先定义“什么是科研任务的完成”,把话语权锁进标准里。 而在此之前,Google DeepMind已凭借AlphaFold等基础模型在AI+科学领域深耕多年,其Gemini for Science平台正将专有资产与数据库捆绑,以平台整合的方式切入同一市场。 AI4S的战局,已经悄然进入“巨头生态混战”阶段,从模型能力的单点比拼,全面切换到了生态位卡位与工作流整合的战场。 01 AI4S撞上了一块怎样的“天花板” 为什么三大巨头偏偏在这个时间点,不约而同地把战火烧到AI4S的底层基础设施? 开头提到,OpenAI这次在GeneBench-Pro中设计了129道题目,完整模拟了真实科研工作流:从原始数据清洗、质控、建模、诊断,一直到得出结论。评分标准是严苛的二元制:只有全部决策正确才算通过。也就是说,哪怕中间分析步骤全对,只要最终结论错了,这道题就是零分。 数据显示,OpenAI最强的GPT-5.6 Sol在Max推理设置下的通过率也只有28.7%,而在非GPT模型中表现最强的Claude Opus 4.8,其通过率仅达到16.0%。 这说明,模型是能够注意到数据异常,识别出局部诊断信号的,但无法将这一认知转化为下游的方法论调整,做出相应的正确分析决策。注意到了问题,但没有改变行动——OpenAI在论文中将这一缺陷,命名为“notice-act gap”。 “识别”与“行动”之间的这道鸿沟从何而来?珞米科技创始人兼CEO吴昊从技术层面指出,通用大语言模型在生命科学领域存在三重结构性短板: 其一,难以直接理解生物原始数据的特殊结构; 其二,生物学中的许多现象无法简单套用文本的tokenization规则,比如基因表达本身具有随机性; 其三,生物学数据中普遍存在大量未知缺失值。 科研成本也是不可忽视的一个因素。GeneBench-Pro数据显示,单道题的人工专家成本高达数千美元。当模型不可靠时,科研机构不得不继续依赖昂贵的人力。除此之外,生命科学领域也对数据合规有着极其严苛的要求。 这就是混
说明:本站展示中文整理摘要,便于快速判断价值;完整内容和版权归原站所有。