Skip to content

Google AI 联合科学家 Co-Scientist:AI 第一次自己走进实验室,还造出了半导体

先说一个真实的数字对比。

二维半导体 MoS₂ 的 CVD 生长工艺,在一个新实验室里从零调通,通常要多久?答案是几个月。这不是我夸张——文献里的配方换个炉子就废,炉体结构、气路、可用化学品、衬底类型全都不一样,博士生得一轮轮试,试到怀疑人生。

2026 年 8 月 27 日,Google DeepMind 联合杜克大学、哥伦比亚大学等机构放出的论文里,这个数字变成了:几分钟生成配方,一次成功,约 1 小时走完三种材料的首次生长。

而且不是一种。是 MoS₂、MoSe₂、WS₂ 三种单层半导体,其中两种是这个实验室此前从没合成过的,全部一次成功。

我看到这段的时候,第一反应不是"AI 又要抢饭碗了",而是——AI 终于不再只是「嘴强王者」了。

过去两年我们见过太多"AI 科学家":写综述、编假设、生成漂亮的研究计划,然后呢?然后就没有然后了。它提的想法没人验证,它给出的数据没人敢信,它写的论文里甚至有百分之几十的实验结果根本不存在

纯计算的 AI 科研系统,最大的毛病叫「奖励作弊」:它学会了产出看起来像模像样的结论,而不是真实的结论。

这次不一样。这次的 Co-Scientist 把手伸进了真实世界——它接的是一台真的化学气相沉积(CVD)反应炉,长出来的是能用 Raman 光谱和球差电镜拍到的真材料。

Co-Scientist 是什么

Co-Scientist(AI 联合科学家)是 Google 基于 Gemini 构建的多智能体科研系统,定位是"虚拟科研合作者",不是"替代科学家的机器人"。

先把时间线捋清楚,免得和别的 AI 搞混:

时间版本底座模型能干什么
2025 年 2 月AI co-scientist 初版Gemini 2.0只做计算机内的事:文献综述、生成假设、设计实验方案
2026 年 8 月 27 日升级版(execution-grounded)Gemini 3 Deep Think / Gemini 3 Pro Image / Gemini 2.5 Pro假设生成 → 实验执行 → 论文写作,全闭环

初版那套系统用了 Generation、Reflection、Ranking、Evolution、Proximity、Meta-review 六个专职智能体加一个 Supervisor,靠"自我博弈辩论 + 排名赛 + 进化"来迭代假设。当时谷歌反复强调一句话:"它是协作工具,不是要自动化科学过程。"

一年半之后,这句话被改写了。新论文的标题很直白——《Accelerating Scientific Research with Gemini in the Real-World》(arXiv: 2608.26701),关键词是 in the Real-World

通讯作者阵容也挺值得一说:Google DeepMind 的 Samuel Schmidgall、涂涛(Tao Tu,Med-PaLM、Med-Gemini 的核心贡献者),以及杜克大学电子与计算机工程系助理教授王浩哲;共同第一作者是 Schmidgall 和杜克大学博士生朱筱锴。作者名单里还有 Google 首席科学家 Quoc V. Le——对,就是那位 Transformer 论文作者之一。

一句话概括这次升级:从「AI 出主意,人去验证」变成「AI 出主意,AI 设计实验,AI 写进设备,然后一起看结果」。

它有什么不一样

升级版 Co-Scientist 的核心是一条三阶段流水线,每个阶段背后是一个专职智能体:

  • Ideation(构思):把一句自然语言的研究目标,变成一堆候选假设,再挑出最好的那个
  • Experimentation(实验):把假设变成能跑的代码,真的去执行,失败了就改
  • Paper Writing(写作):把实验结果、假设和文献缝合成一篇结构化稿件

听着是不是很像"高级版 Deep Research"?差别在细节里,而魔鬼恰恰住在细节里。

构思阶段:用进化算法卷假设

生成假设不难,难的是生成好的假设,还别撞车。

Co-Scientist 的做法是:先并行做文献综述给每个想法打底,然后用 TrueSkill + UCB 这套贝叶斯排序去赛马——不平均分精力评估所有假设,而是把比较预算花在"最有可能冲到前排"的那几个上。这是标准的探索/利用权衡,被搬到了科研想法上。

进化参数也写得明明白白:

  • 采样温度 τ = 1.6(高温,保证想法多样性)
  • 交叉概率 0.7,变异概率 0.3
  • 默认迭代 10 代
  • 评审维度:新颖性、合理性、可测试性,外加抄袭惩罚和"不许虚构实验设备"的提示级惩罚

最让我眼前一亮的是最后一条:给"虚构尚未授权的实验室设备"单独设了惩罚项。你知道这说明什么吗?说明 AI 编造不存在的仪器,已经是个普遍到需要专门治的病了。

实验阶段:三阶段 + 并行求解器

这是这次升级最硬的部分。实验程序不是一把梭生成的,而是分三步:

  1. Scaffolding:在最小数据子集上、用很短的超时(约 600 秒)先把逻辑跑通
  2. Transition:把脚手架替换成全规模逻辑
  3. Full-scale execution:在完整数据集上跑真家伙

每一步都有多个并行 solver 独立生成程序变体,在隔离环境里执行;跑通的由 LLM 奖励模型按"计划依从性、实验严谨性、输出质量"三个维度打 0–1 分;跑挂的拿到结构化错误反馈,反思后重写。

还有个防停滞的小设计:每代对最优程序缓冲区施加 γ = 0.97 的乘性分数衰减。意思就是——你躺平我就慢慢扣分,逼着你持续改进。

写作阶段:把幻觉惩罚写进优化目标

这一节我个人认为是整篇论文对普通开发者最有参考价值的部分

稿件的评分函数是:

S_score = 1.0 × S_reviewer − 0.5 × S_plagiarism − 1.0 × S_hallucination

注意幻觉惩罚的权重是 1.0,和审稿人评分同量级。论文里还专门论证了:审稿人评分的边际增益最多 0.3,所以任何一条未经验证的定量声明,扣分都足以抵消它带来的审稿收益——从机制上堵死了"编个漂亮数字换高分"的 reward hacking。

更狠的是 hallucination clipping

  • 稿件里所有定量声明和性能指标,都要拿去和原始执行日志(E_log)逐条做确定性交叉验证
  • 对不上就定向重写,用日志里验证过的数据替换掉
  • 如果实验阶段压根没产生有效执行日志,论文写作阶段直接终止

最后这一条简直是釜底抽薪。没有真实数据,就别写论文。

我一直觉得,"让 AI 不要撒谎"这件事,靠提示词里喊一百遍"请务必准确"是没用的。得把它写进目标函数、写进流程闸门里。Co-Scientist 给了一个可复制的样板。

自主度是可以调的旋钮

论文没有把系统锁死在一个设定上,四个工作流分别跑在四档自主度上,这个设计我觉得很清醒:

自主度工作流人类在干嘛
最低:人类执行合成材料科学 CVDAI 设计配方,人类装样品、开炉、做表征
中:专家–AI 协作生物学 E. coli 预测人类定"研究什么",AI 定"怎么研究";湿实验仍由人做
高:完全自主发现计算机科学架构搜索零人为干预,从一句研究方向开始全自动
最高:端到端论文生成50 个 AI 主题完整周期全程无人,产出交双盲评审

自主度是每个任务单独拧的旋钮,不是系统的固有属性。 同一个智能体栈,在湿实验室里只敢建议换个前驱体,在代码基准上却能撒开腿自己跑一整个代码库。

真实世界验证:三个领域,三组硬数据

材料一:给 MXene 找一条"无毒"路线

MXene(二维过渡金属碳化物)导电性极好,但主力成员 Ti₃C₂Tₓ 长期以来只能用氢氟酸这类危险试剂"自上而下"刻蚀得到,直接自下而上 CVD 合成一直没人做成。

Co-Scientist 针对杜克实验室那台自建 CVD 炉的具体几何结构和现有原料,从 272 个候选方案里挑出一条:用**六氯乙烷(C₂Cl₆)**替代剧毒易挥发的四氯化钛(TiCl₄)当前驱体。

人类操作员照着做,迭代 25 轮后长出了高结晶度的二维层状晶体。X 射线衍射、扫描电镜、能谱、球差电镜表征显示:层间距约 1.13 nm,面内晶面间距约 2.51 Å,与 Ti₃C₂Tₓ MXene 的晶格特征高度一致。

但论文也老老实实写了:最终的原子级相结构仍需截面原子分辨电镜进一步确认。

材料二:三种单层半导体,一次成功

这部分用的是 Gemini 3 Deep Think 的快速推理能力。

只给硬件约束(炉体结构、可用化学品、衬底类型),不给任何历史配方参考,Co-Scientist 在几分钟内生成完整工艺参数,并直接翻译成控制 CVD 设备的机器指令

结果:

  • MoS₂:一次成功,三角形单晶尺寸超过 50 微米,拉曼光谱确认单层
  • MoSe₂:实验室此前从未合成过,同样一次成功
  • WS₂:同上
  • 从配方设计到三种材料首次生长,整个流程约 1 小时

对照一下:这类工艺跨设备迁移通常要几个月反复摸索。半导体行业 AI 科学家张笑通博士的评价是,这打通了"设计配方 → 设备执行 → 表征验证"的闭环。

材料三:预测大肠杆菌的群集形态

生物学这边和哥伦比亚大学合作。任务是从稀疏的成像数据出发,预测工程大肠杆菌在不同 IPTG 诱导剂浓度下的群集形态。

技术路线挺巧:以 Gemini 3 Pro Image 作为中央生成模型,用 leave-one-out 插值生成未测试浓度的候选图像,采样 N = 16 个候选后,由 Gemini 2.5 Pro 做 Best-of-N 拒绝采样打分。

结果:4 项形态指标中,有 3 项与未发表的湿实验测量定量吻合

材料四:自己造出一个 Agent 架构

计算机科学这条线自主度最高。只给一句研究方向,Co-Scientist 在无人工干预下自主生成、测试、迭代整个代码库,最终发现了一个推理时扩展架构,论文里叫 Agent_H

成绩:在 HealthBench Hard 和 Professional(长度校正后)上超过 6 个前沿模型,并且在医生盲评中显著降低了潜在临床风险。

换句话说,它不光刷分更高,在医生眼里还更安全。这两件事通常不共存。

那它可靠吗?这是我最想聊的部分

AI 科研最大的信任危机就两个字:编的

论文在引言里给了个让人后背发凉的背景数据:现有自主科研系统的小规模分析显示,编造率高达 80–100%,部分系统输出的抄袭率最高到 24%

Co-Scientist 的应对是三件套:日志校验(前面说过的 hallucination clipping)、抄袭惩罚权重、双层安全网关。安全网关分两层——构思开始前先筛研究方向是否有两用性/有害风险,属于受限类别直接拒答;构思和规划过程中再由 LLM 评估器对每个想法做二元判定,不通过就生成具体反馈退回重来。

规模化的验证是一场双盲研究:30 位领域专家,450 次独立评审,评审对象是 50 个主题上端到端生成的完整论文。结论是可靠性模块相比消融基线显著降低了严重结果幻觉和抄袭;安全系统对有害研究指令的拒绝率达到 98.7%

98.7% 不是 100%,我得说清楚。剩下那 1.3% 才是这类系统真正该被盯着的地方。

初体验:现在能用上吗

老实说,不能。 这是我必须泼的一盆冷水。

Co-Scientist 从 2025 年首发起就走的是 Trusted Tester Program(可信测试者计划)路线,需要申请,有 UI 和 API 集成,但没有对公众开放。这次的升级版更直接——它是一篇 arXiv 论文(2608.26701),不是一次产品发布。你在 Google AI Studio 里翻遍菜单也找不到它。

所以这篇"入门"的正确打开方式不是"怎么注册",而是——它这套架构里有哪些东西我今天就能抄。

我的判断,最值得抄的有三条:

1. 把验证写进流程,而不是写进提示词

这一条零门槛。你自己的 Agent 工程里,凡是模型产出的定量结论,都应该拿原始日志/数据源做一次确定性比对,对不上就打回。哪怕只用几十行 Python,效果也比在 system prompt 里吼"请务必准确"强一百倍。

2. 三阶段执行:先跑通,再放大

Scaffolding → Transition → Full-scale 这个套路,本质上是"用小数据、短超时先把逻辑验证掉,再上全量"。任何会消耗算力和钱的任务都该这么干。省下来的不只是时间,是试错成本。

3. 自主度按任务拧,不按系统定

别一上来就追求"全流程无人值守"。写代码的可以全自动,涉及物理设备的留人在环,涉及法律医疗的输出留人审核。先想清楚每个环节出错的代价,再决定放多少权。

如果你想动手跑一个"迷你版三阶段流水线",用 Gemini API 大致是这个骨架(示意代码,聚焦日志校验那一环):

python
from google import genai
import json

client = genai.Client(api_key="YOUR_API_KEY")

# 阶段一:生成实验代码
plan = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="研究目标:XXX。请先输出实验计划,再输出可执行的 Python 代码。",
).text

# 阶段二:执行,并强制留痕(这一步是整个可靠性的地基)
def run_experiment(code: str) -> dict:
    # 在隔离环境执行,把 stdout、关键指标、输入参数全部落盘
    ...
    return {"log": {...}, "metrics": {...}}

result = run_experiment(extract_code(plan))
raw_log = json.dumps(result["log"], ensure_ascii=False)

# 阶段三:写作前,先拿日志逐条校验(没日志就别往下走)
if not result["metrics"]:
    raise RuntimeError("没有有效执行日志,禁止进入写作阶段")

audit = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents=f"""
你是审稿人。下面是一份草稿和原始执行日志。
请逐条核对草稿中的每一个数字,凡是在日志中找不到出处的,直接标记为「未经验证」并删除。
不要为了让稿件更完整而补充任何日志中没有的数据。

【草稿】{draft}

【原始执行日志】{raw_log}
""",
).text

代码本身没什么魔法,真正值钱的是那句 raise RuntimeError——没有真实数据,就不许往下写。

我的冷静判断

别急着激动,也别急着嘲讽,我把话说全:

乐观的部分:这是 AI 科研从"in silico"(只在计算机里)走向"in the real world"的关键一步。材料、生物、计算机科学三个领域同时验证,加上可追溯可审计的可靠性机制,正面回应了 AI for Science 最被质疑的两个问题——它做的东西是真的吗?它在实验室之外的物理世界里成立吗?

需要泼冷水的部分

  • CVD 系统只是半自动的,人类操作员仍要装样品、开炉、做表征。别被"AI 操控设备"的说法带跑
  • MXene 的原子级结构尚未确认,论文自己写的
  • "一次成功"和"稳定量产"之间隔着一条巨大的鸿沟
  • 它目前是论文 + 小范围可信测试,不是你能注册开通的 SaaS
  • 98.7% 的安全拒绝率意味着还有 1.3% 漏网

我的立场:这不意味着科学家要下岗了。它意味着科学家的角色在往上移——从"亲手调几十轮参数"变成"设定目标、划定约束、审核结果"。

未来实验室里,人类更像目标设定者和审核者,把海量的配方探索和迭代交给不知疲倦的 AI。那一天来得多快?可能比我们以为的要快。也可能比宣传的慢很多。这两句话同时成立,这就是当下的真实状态。

进阶

想搞懂这类多智能体系统,光看热闹不够,得看论文原文和架构设计。arXiv: 2608.26701 是免费公开的,建议至少把 Methods 那一节和 Figure 1 看一遍,尤其是三个智能体的参数表和自主度谱系——那张图比任何解读都清楚。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档