跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 41–60 条 · 共 60 条
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的设备上运行,并首次在中等规模模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能差距。

5月22日周五
  1. Mistral AI82

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的可行边界。

5月18日周一
5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断速度与质量能否兼得。

4月16日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布新一代文本转语音模型 Gemini 3.1 Flash TTS,主打更强的可控性、表现力与语音质量,已在 Gemini API 和 Google AI Studio 面向开发者预览、在 Vertex AI 面向企业预览,并通过 Google Vids 向 Workspace 用户开放。

    推荐理由:官方给出 Elo 1,211 与多说话人、70+ 语言等能力,可据此判断语音生成的可控性提升。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在巡检等场景的自主程度。

3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与低延迟特性。

    推荐理由:Mistral 首款 TTS 模型给出参数量、延迟与定价,并附与 ElevenLabs 的对比评测,可据此判断企业语音栈的选型空间。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的新一代模型,首次把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中,采用 Apache 2.0 许可。

    推荐理由:Mistral 把推理、多模态与编码能力合并进单一开源模型,并给出可配置推理强度与部署门槛。

  2. Mistral AI62

    Mistral 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。

2月5日周四
  1. Mistral AI74

    Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

    Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。

    推荐理由:Mistral 一次放出批量与实时两款语音转写模型,并给出延迟、错误率与价格对比,可据此判断语音应用的选型空间。

12月17日周三
  1. Mistral AI62

    Mistral 发布 OCR 3,表单与手写识别胜率较上一代提升 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业文档处理方案和 AI 原生 OCR 方案。

    推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与每千页定价,便于评估文档解析管线的替换成本。

12月9日周二
12月3日周三
7月15日周二
  1. Mistral AI80

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral 发布 Voxtral 语音理解模型,提供 24B 生产级和 3B 本地/边缘两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,并内置问答、摘要、多语言识别和语音触发函数调用。

    推荐理由:Mistral 开源语音理解模型,给出两种尺寸、32k 上下文与 API 定价,可据此判断语音转写与理解的成本与部署选择。

7月11日周五
6月10日周二
5月21日周三
  1. Mistral AI71

    Mistral AI 与 All Hands AI 发布编码智能体模型 Devstral

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 模型 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:官方给出 Devstral 在 SWE-Bench Verified 上的分数与开源许可,读者可据此判断开源编码智能体的当前水位。

5月7日周三
3月17日周一