Google DeepMind 发布 SL2T 手语转文字模型,首发落地 Pixel 11 的 Gboard 与 Live Transcribe
Google DeepMind 发布多语言手语转文字模型 SL2T,首次把该能力带入消费级产品:Pixel 11 上的 Gboard 和 Live Transcribe 支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方给出 SL2T 的训练规模、基准分数与隐私设计,可据此判断手语转文字在消费级产品中的可用边界。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 发布多语言手语转文字模型 SL2T,首次把该能力带入消费级产品:Pixel 11 上的 Gboard 和 Live Transcribe 支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方给出 SL2T 的训练规模、基准分数与隐私设计,可据此判断手语转文字在消费级产品中的可用边界。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,采用 Apache 2.0 许可,面向本地智能体场景,可用于编码、文档分析和个人助手。
推荐理由:Meta 开源 30B 多模态模型并给出完整基准对比与本地部署路径,可据此判断端侧智能体的可用性。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预测上达到 SOTA,平均多出一天预警时间,相当于气象领域约十年的进展。
推荐理由:WeatherNext 在气旋路径与强度预测上取得约一天提前量,并开源模型权重与代码,读者可据此了解 AI 天气预报的当前进展与可用入口。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为策略自适应的问答任务,推理时接受自然语言策略并输出校准后的安全分数,无需重新训练,可在单张 16GB NVIDIA GPU 上运行。官方称其在文本安全上可匹配参数量最高 7 倍的模型,并在多模态审核上取得新的 SOTA。
推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类法,读者可据此判断内容审核的部署方式变化。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可对照上一代判断具身推理的进展。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作与多机器人协作。
推荐理由:官方给出三款模型的职责分工与端侧适配数据,可据此判断机器人全身控制与多机协作的落地路径。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体规模化部署的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比数据与受限开放方式,可据此判断专用小模型在代码安全场景的定位。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,可据此判断具身导航对传感器配置的依赖程度。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数、仅 6B 激活参数的形式化验证模型,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34% 的 SOTA 成绩。
推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与单题成本,读者可据此判断开源证明模型的性价比。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出了延迟、单价与开放入口,读者可据此判断图像与视频生成链路的成本与可用性。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中完成预测。
推荐理由:原文给出 TabFM 的架构机制、合成数据训练方式和 TabArena 基准结果,可据此判断零样本表格预测的可用性。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器完全自托管部署。官方称独立标注者在 600 多份文档的盲评中平均 72% 更偏好 OCR 4,其在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,但官方也指出这两个基准在数学、科学和多栏文档上存在评分偏差。
推荐理由:OCR 4 在文本之外返回边界框、块类型与置信度,并给出 API 与自托管两种落地路径,便于判断其接入 RAG 与智能体流程的成本。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理提速,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据、硬件门槛与质量取舍,便于判断本地低并发场景是否值得尝试。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:Google 发布支持 70+ 语言的实时语音翻译模型,并给出开发者、企业、消费端三条落地路径。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的设备上运行,并首次在中等规模模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能差距。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断速度与质量能否兼得。
Google DeepMind 发布新一代文本转语音模型 Gemini 3.1 Flash TTS,主打更强的可控性、表现力与语音质量,已在 Gemini API 和 Google AI Studio 面向开发者预览、在 Vertex AI 面向企业预览,并通过 Google Vids 向 Workspace 用户开放。
推荐理由:官方给出 Elo 1,211 与多说话人、70+ 语言等能力,可据此判断语音生成的可控性提升。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在巡检等场景的自主程度。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与低延迟特性。
推荐理由:Mistral 首款 TTS 模型给出参数量、延迟与定价,并附与 ElevenLabs 的对比评测,可据此判断企业语音栈的选型空间。