认识 Project Astra:谷歌想塞进你手机和眼镜里的"全能 AI 助理"
昨天(8 月 12 日),谷歌放了个大数字:Gemini 月活用户突破 10 亿,成了谷歌史上增长最快的产品。更狠的是,现在 63% 的 Gemini 用户在用语音,完全靠说话跟 AI 互动的人还在涨。
我第一反应是:聊天框这个形态,快到头了。
你想啊,10 亿人天天对着一个输入框打字问问题,这画面其实挺别扭的。真正顺手的状态应该是——你举着手机对着家里的破家电,它直接告诉你"水箱没水了,先加两杯";你戴着眼镜看路牌,它默默把外文翻好浮在你眼前。
这种"不用打字、能看见你、还能顺手帮你干活"的 AI,谷歌早就在偷偷搞了,名字叫 Project Astra。今天这篇不教你调 API,先把窗户打开:Astra 到底是个啥?
一句话先垫着:Gemini 是那个"聪明的大脑"(模型),Project Astra 是站在大脑肩膀上、能看会动手的"全能助理"(智能体)。大脑负责想,Astra 负责办。
Project Astra 是什么
官方定义很克制但野心很大:Project Astra 是 Google DeepMind 在通往**"通用 AI 助理"(universal AI assistant)**路上,给谷歌自家产品探索突破性能力的项目。
别被"研究项目"四个字骗了,它可不是 PPT 上的概念。DeepMind 自己说,Astra 的很多能力最先就是在 Astra 里试出来的,然后才被搬进 Gemini Live 给更多人用——比如屏幕共享、实时视频理解这些你现在就能玩到的功能。
所以它是个"能力层":一边在实验室里打磨,一边把成熟的部分陆续塞进 Gemini Live、Search 的新体验、以及眼镜这类新形态设备里。
| 你可能在用的 | 它和 Astra 的关系 |
|---|---|
| Gemini(模型) | Astra 的"大脑",负责理解和推理 |
| Gemini Live | Astra 探路出来的语音/视觉能力,最先落地的消费级入口 |
| Google Search / Maps / Gmail / Calendar | Astra 会调用的"工具",用来真帮你办事 |
| Android XR 眼镜 | Astra 想住进去的下一个形态 |
Demis Hassabis(DeepMind 掌门人)在 I/O 2026 上的原话挺霸气:"我们不是在造一个聊天机器人,我们是在造一个和你生活在一起的通用 AI 助理。"
它有什么特别之处
把 Astra 拆开看,核心就三大块能力,每块都戳在"聊天机器人做不到"的地方:
- 自然交互(Natural interaction):音频输入输出做了大幅升级,跨语言对话不打断;响应速度比"即便是我们最快的模型"还快;能主动开启对话——比如你刚进门它就说"你该出发了,按现在路况能准点";还能自动忽略背景噪音和无关对话,只听你真正在说的。
- 行动智能(Action intelligence):这才是和"聊天"的本质区别。Astra 能实时高亮屏幕上的关键物体告诉你"看这儿",还能直接调用工具办事——Search 查资料、Gmail 发邮件、Calendar 排日程、Maps 导航,甚至控制手机界面去点按钮。
- 个性化记忆(Intelligent personalization):它记得你。基于深度推理和记忆,它越用越懂你的偏好,连购物推荐都能按你口味来;能调取你分享过的东西(一份 PDF 说明书、一个菜谱)来帮你;更关键的是多模态记忆——把视频、语音、文字揉在一起,记住你过去聊过的关键细节,下次接着聊。
还有一个细节很谷歌:Astra 目前明确是研究原型(research prototype),只对有限的"信任测试者"开放,想玩得去官网排 waitlist。这说明它还没ready到人手一个,但方向已经锁死。
说人话总结它的气质:别的 AI 在"等你问",Astra 在"帮你办"——而且它还记得你上周说了啥。
它能干啥(真实场景,不是科幻)
光列能力太虚,几个能让你"哦——"一下的场景:
1. 给视障朋友的"眼睛" 这是 Astra 最打动我的一块。DeepMind 和视障社区、视觉解读服务公司 Aira 合作,做了个 Visual Interpreter 原型:镜头一动,它就能描述看见的东西;配合 Maps、Photos、Lens,能帮视障用户认路、认物体。官方案例里那位叫 Dorsey Parker 的音乐人,只剩 8% 视力,他用手机让 Astra 描述周围环境、借助 Lens 和 Maps 探索陌生地方。技术在这里不是炫技,是真的在补短板。
2. "看"着东西跟你聊 把手机镜头对准白板上的公式,它能一步步讲;对准坏掉的家电,它能带你去修。AlphaSignal 在 ICML 2026 的现场报道里提到的核心逻辑很准:Astra 把视频和音频当成一条连续的流来处理,而不是一帧一帧地看——这就是为什么它对话不卡顿、上下文不丢。
3. 办公自动化(这个最实用) 按 I/O 2026 披露的方向,Astra 计划 2026 年 Q3 进 Google Workspace,作为一个常驻侧边栏:你能对它说"总结这份 47 页合同、提取终止条款、起草给供应商的回复邮件、周二约法务开个会"——它一气呵成。把"读文档+写邮件+排会议"三件事串起来,这才是打工人要的 AI。
4. 眼镜里的导航和翻译 配合 Android XR 原型眼镜(谷歌和三星、Warby Parker、Gentle Monster 有合作,音频眼镜预计 2026 年秋季),你不用掏手机,AI 就懂你眼镜看见的世界——看向路牌出翻译,看向餐厅出评分。
5. 跨设备接着聊 在手机上聊到一半,换眼镜或者换设备,对话和记忆能接上。这点对"常驻助理"至关重要——它得是跟着你走,而不是锁在某一个屏幕里。
初体验:普通人怎么"摸到" Astra
别被"DeepMind 研究项目"吓退,你现在就能沾到它的边:
- 直接上 Gemini Live:打开 gemini.google.com 或 App,开摄像头 / 共享屏幕,就能体验到 Astra 探路出来的能力。注意,这些进阶能力通常要 Google One AI Premium(即 Gemini Advanced) 订阅才全。
- 开发者走 API:Astra 的能力已经通过 Gemini API 开放给多模态和智能体原型开发,配合 Google AI Studio 免费用 Gemini 做实验。
- 想当"内部人":去 deepmind.google/models/project-astra 填表加入信任测试者 waitlist,等官方放名额。
- 盯硬件:Android XR 眼镜是 Astra 的下一个家,2026 年陆续有音频眼镜落地,想体验"看见即翻译"可以关注。
新手建议:先别纠结架构和 API。打开 Gemini Live,把摄像头对准你桌上一团乱的线,问它"哪根接显示器"——那一秒钟的"它居然看懂了",比读十篇技术文都值。
一个必须厘清的关系
很多人把 Gemini、Gemini Live、Astra 搞混,记住这条线就够了:
- Gemini = 模型(底层大脑,负责看懂、听懂、想明白)
- Gemini Live = 语音 + 视觉对话入口(你能跟它说话、给它看画面)
- Project Astra = 跑在 Gemini 之上的"通用助理"愿景与能力层(会记、会动手、会跨设备)
Astra 是那个"终局目标",Gemini Live 是当前离它最近的消费级产品,而 Gemini 是它脚下的地基。谷歌现在的打法很清楚:先把 Astra 的能力一片片下放到 Gemini Live 和 Search,等眼镜这类新形态成熟,再整个搬过去。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档