跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 41–60 条 · 共 61 条
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的设备上运行,并首次在中等规模模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能差距。

6月8日周一
  1. Google DeepMind62

    Google DeepMind 公布塞拉利昂 AI 教学试验结果

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。

    推荐理由:原文给出塞拉利昂预注册试验的量化结果与交互数据,读者可据此判断 AI 辅助教学的实际效果与边界。

6月5日周五
  1. Google Research60

    Google 在 Gemini Enterprise Agent Platform 上线 Agentic RAG 版跨语料检索

    Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 和 Sufficient Context Agent 等角色协作处理多源多跳查询。

    推荐理由:原文给出多智能体 RAG 的架构细节与跨语料检索准确率数据,可据此判断企业检索场景的落地方式。

6月4日周四
  1. Google Research60

    Google 开源水文建模框架,支持机构自建 AI 洪水预报

    Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。

    推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可据此判断本地洪水预报如何接入自有数据。

5月20日周三
5月17日周日
  1. Google DeepMind68

    Google 将 SynthID 与 C2PA 内容验证扩展到 Search、Gemini、Chrome 和 Pixel

    Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能已在全球被使用 5000 万次。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可据此了解内容溯源工具的实际覆盖范围。

5月16日周六
  1. Google DeepMind62

    斯坦福团队用 Co-Scientist 筛选抗肝纤维化药物

    斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药。

    推荐理由:斯坦福团队用 Co-Scientist 筛选抗纤维化药物,实验显示其候选药优于人工挑选,可观察 AI 辅助药物重定位的实证效果。

  2. Google DeepMind66

    WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加

    Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。

    推荐理由:原文给出 WeatherNext 在飓风路径与强度预测上的实际表现,读者可了解 AI 天气模型在极端事件中的落地方式。

  3. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断速度与质量能否兼得。

5月12日周二
5月6日周三
  1. Google DeepMind74

    Google DeepMind 发布 AlphaEvolve 一年落地成果

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,涵盖数学、量子物理、基因组学、电网优化和 AI 基础设施等领域。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,从基因组到 TPU 设计,可看编码智能体在真实基础设施中的边界。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。

    推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。

4月23日周四
4月22日周三
  1. Google DeepMind62

    Google DeepMind 提出 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为解耦的计算孤岛,孤岛间以异步数据流通信,从而隔离局部硬件故障并降低带宽需求。

    推荐理由:原文给出跨数据中心异步训练的具体带宽与加速数据,读者可据此判断分布式预训练的工程可行性。

4月16日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布新一代文本转语音模型 Gemini 3.1 Flash TTS,主打更强的可控性、表现力与语音质量,已在 Gemini API 和 Google AI Studio 面向开发者预览、在 Vertex AI 面向企业预览,并通过 Google Vids 向 Workspace 用户开放。

    推荐理由:官方给出 Elo 1,211 与多说话人、70+ 语言等能力,可据此判断语音生成的可控性提升。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在巡检等场景的自主程度。

3月31日周二
  1. Google Research66

    Google Quantum AI 发布白皮书:量子计算机破解加密货币椭圆曲线密码所需资源大幅下降

    Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子比特和门数比此前认为的更少。

    推荐理由:Google Quantum AI 给出破解 ECDLP-256 的更新资源估算,并用零知识证明确认结论,读者可了解量子威胁与后量子迁移的紧迫性。

3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR:用 Gemini 和 XR Blocks 把自然语言变成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,把 Gemini 与基于 WebXR 的 XR Blocks 框架结合,可将自然语言提示直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。

    推荐理由:Google 把 Gemini 的长上下文推理接到 WebXR 框架上,读者可据此判断自然语言生成 XR 原型的可行边界。