Anthropic 推出 Claude Science:面向科学家的可审计 AI 工作台 Anthropic 于 2026 年 6 月 30 日以 beta 版形式推出 Claude Science一个面向科学家的 AI 工作台。这不是一个简单的聊天工具而是把科研流程中分散的数据库、文件格式、计算资源和写作环节统一收进同一个可审计的交互环境。 解决的核心问题科研流程的碎片化 官方公告点明了一个被多数人低估的问题科研工作往往较为繁琐研究人员需要在多个数据库、数据格式和工具之间频繁切换。研究者需要在 PubMed、Jupyter、R、集群终端之间来回切换处理不同 schema 的数据库应付需要专门 pipeline 和查看器的文件格式。Claude Science 把这些碎片化工具整合到一个研究环境中试图让科学家在统一的研究环境中完成文献分析、多步骤研究、图表和手稿迭代。 从工程角度看这里真正值得关注的是它没有做成云端 SaaS而是像 Jupyter Notebook 一样可以在本地或远程运行。官方明确支持 macOS、Linux 本地运行也支持通过 SSH 连接远程机器或 HPC 登录节点。这意味着实验室现有的计算基础设施可以继续使用不需要把数据搬到 Anthropic 的服务器上。 可审计产物不只是生成结果 Claude Science 的关键设计之一是可审计产物。官方说明指出当代理生成一张图或一份手稿时会同时包含产生该结果的精确代码、运行环境、生成方式的自然语言描述以及完整消息历史。这意味着即使几个月后回看也更容易依据代码、环境、描述和消息历史验证并复现实验过程。 这对科研场景是决定性差异。论文审稿和实验室复现依赖的不是模型最终输出的答案而是答案背后的输入、推理过程和可执行代码。一个能自我校正的 reviewer agent 会在 pipeline 运行过程中检查输出标记错误的引用、无法追溯的数字以及与底层代码不匹配的图表。 对开发团队而言可以把这套机制理解为一个Agent 环境快照 审计日志的组合。它不是简单地让模型写代码而是让模型拥有一个持久的运行会话会话里的代码、数据和上下文可以被随时检查、克隆和复现。 超过 60 个技能与领域连接器 Claude Science 预配置了超过 60 个经过精选的技能和连接器覆盖基因组学、单细胞、蛋白质组学、结构生物学、化学信息学等领域。用户通过一个通用协调代理与系统交互这个协调代理可以启动子代理也可以调用用户创建的专用代理。 官方明确列出了它在生物学场景中对接的数据源UniProt、PDB、Ensembl、Reactome、ClinVar、ChEMBL、GEO 等。这些数据库各有自己的 schema 和查询语言普通研究者很难全部掌握。Claude Science 的价值在于用自然语言提问后专用代理会自动查询和汇总这些异构数据源。 此外它还集成了 NVIDIA BioNeMo Agent Toolkit 中的技能可以连接 Evo 2、Boltz-2、OpenFold3 等生命科学模型和库。这意味着科研人员已经信任的模型和 pipeline 可以继续使用官方表示可以连接这些已有工具。 算力管理从笔记本到 HPC 集群 大型分析任务比如蛋白质折叠或超大规模基因组学 pipeline通常需要研究者把大量精力花在提交作业、排队等待、检查状态和拉回结果上。Claude Science 设计了一套算力管理机制代理会先起草一个计算计划在接触新资源前先征询用户同意用户可以在写入和提交任务前审查或撤销任何决定作业提交到实验室已有的计算资源上通过 SSH 连接自有 HPC 集群或通过 Modal 账号按需获取计算分析规模可以从单个 GPU 扩展到数百个 GPU更值得关注的是代理运行在一个持有上下文内存的活动会话中。官方明确说明即使非常大的数据集也只需要加载一次后续处理无需重复加载。同时大型或敏感数据集可以留在实验室自己的基础设施上只有每一步分析所需的上下文会被发送给 Claude。对科研团队来说这个设计直接触及了数据安全和算力成本的痛点。云端 AI 工具再强如果要求把所有数据上传很多生物医学研究就无法使用。Claude Science 的设计是算力可以按需扩展但数据可以留在实验室自己的基础设施上这在实际落地中可能比模型能力本身更重要。早期应用案例透露的真实工作流官方公布了三个合作案例每个都能看出不同的科研场景Manifold Bio 利用 Claude Science 进行组织靶向药物设计。它需要评估大量候选分子在不同组织和靶点中的表达、运输和安全性。此前这类工作需要一个通用编码助手配合人工大量收集和判断数据。Claude Science 能端到端完成这个流程收集正确的数据结合 Manifold 内部专有数据的上下文应用判断。关键在于上下文——代理不是孤立地分析而是把过去项目的上下文纳入当前评估。Allen Institute 的 Jérôme Lecoq 构建了一个多代理计算评审模板包含约 20 个自定义技能。子代理阅读数千篇论文提取核心主张和关键定量发现存入一个证据状态数据库随后 pipeline 构建叙事结构逐节撰写评审并委派给各自的专责子代理。这个案例最有技术参考价值的是actor-critic pairs设计一个代理负责生成内容另一个独立的评审代理负责评估准确性和引用保真度。Lecoq 团队过去写这样的综述可能需要两年现在已有约 10 篇综述其中多篇超过 100 页。UCSF 的 Stephen Francis 实验室研究胶质瘤分子流行病学重点关注大量小效应生殖系变异如何结合起来影响个体易感性。Francis 表示Claude Science 将多种方法综合的生殖系分析速度提升了约 10 倍且该小组独立验证了结果。这些案例的共同点不是AI 替换科学家而是AI 接管流程中的调度、检索、计算和审校环节科学家保留判断和决策权。什么还不确定官方没有披露 Claude Science 的底层模型版本也没有公开任何 Benchmark 数据。宣传中提到的速度提升约 10 倍来自合作实验室自我报告不是标准测试。对科研团队来说复现验证仍然是不可跳过的一环。从工程角度看Claude Science 更像一个可扩展的 Agent 平台它用 skills 和 connectors 连接外部工具用会话上下文管理长流程用 reviewer agent 做输出校验用人工审批控制计算资源访问。这个架构不局限于生命科学但在生命科学这种数据源异构、流程长、容错率低的场景中价值最明显。对中国 AI 开发者而言真正值得借鉴的可能是它的落地策略不试图替代实验室已有工具而是通过技能、连接器和可复用 pipeline 融入现有基础设施。AI 工作台的竞争或许将从模型参数转向生态连接能力和可审计性。