跳到正文
10月4日 · 周日

最新精选

10月2日周五
  1. The Decoder78

    Black Forest Labs 发布 Flux 3 Image,支持多步局部编辑

    Black Forest Labs 发布 Flux 3 模型家族的图像部分 Flux 3 Image,官方称其支持多步编辑且不改变画面其他区域,覆盖文生图、图生图、文字渲染和写实生成。

    推荐理由:Flux 3 Image 支持多步局部编辑并给出免费试用与 API 折扣,可据此判断其与同期图像编辑模型的差异。

10月1日周四
  1. Hugging Face Blog60

    AI2 发布 Olmo-core 3:面向万亿参数 MoE 的开源训练基础设施

    AI2 发布 Olmo-core 3,这是其大语言模型训练框架的一次重大升级,重新设计了开放的 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。

    推荐理由:原文给出了 MoE 训练栈的吞吐与显存对比数据,读者可据此判断万亿参数 MoE 训练的开源方案成熟度。

  2. The Decoder78

    Google 发布 Gemini 4 Argon,基准追平 OpenAI 与 Anthropic 但未明显领先

    Google 发布新前沿模型 Gemini 4 Argon,在多项基准上缩小与 OpenAI、Anthropic 的差距,但未取得明显领先。该模型先向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才面向开发者、企业和消费者,推广价输入 $2/百万 token、输出 $10/百万 token,缓存输入便宜 95%。

    推荐理由:汇总第三方基准与定价数据,读者可据此判断 Gemini 4 Argon 与 OpenAI、Anthropic 前沿模型的差距和成本位置。

  3. Latent Space82

    Google DeepMind 发布 Gemini 4 Argon,支持 100 万 token 输出

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。

    推荐理由:汇总 Gemini 4 Argon 的基准、定价与内部部署数据,并列出评测机构与观察者的质疑,便于对照判断其真实水平。

  4. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准成绩和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 发布 SynthID Bio,把水印技术引入合成生物学,将不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印从图像扩展到合成生物学,读者可了解其在 DNA 合成筛查与数据库标注中的验证层作用。

9月29日周二
  1. Hugging Face Blog66

    NVIDIA 发布表格基础模型 Kumo Tabular,四个基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 NVIDIA Kumo Structured 模型集合,已在 Hugging Face 上线。

    推荐理由:原文给出表格基础模型的架构、训练数据来源与四个基准排名,可据此判断免训练表格预测的可用边界。

  2. Microsoft Research62

    微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨模态生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

  3. OpenAI News82

    OpenAI 发布 GPT-6.1 Sol,面向编码与计算机操作

    OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。其标准 API 输入与输出 token 价格为 Astra 的五分之一。

    推荐理由:OpenAI 发布 GPT-6.1 Sol,给出与 Astra 的能力定位和五分之一价格对比,可据此判断成本与适用场景。

  4. Latent Space78

    AINews:Opus 5.5 擅长生成讲解视频

    Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。

    推荐理由:汇总 Opus 5.5 发布一周内社区实测与榜单表现,并梳理 Jev、Perplexity Photon 等同期动态,便于快速把握当周模型与工具格局。

  5. Simon Willison78

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。

    推荐理由:作者用同一套鹈鹕提示词实测新 Sonnet,并对比免费层能力,可据此判断性价比与可用性。

  6. AWS Machine Learning Blog62

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它与 Opus 5.5 的分工。

9月28日周一
  1. Hugging Face Blog71

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机智能体的成本与能力边界。

9月25日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、表情和自然轮次切换的视觉化对话。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级多模态智能体的落地形态。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 的定位差异、语音克隆与逐行导演能力,以及基准排名和开放入口。

  2. Latent Space88

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并降价 40-50%

    Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同日两家发布新模型并同步降价,读者可对比能力、定价与 token 消耗之间的取舍。

  3. Simon Willison88

    Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布,新一轮价格战开启

    Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者认为新一轮价格战已经开启。

    推荐理由:作者实测并列出各家新模型价格表,读者可据此判断这一轮降价对智能体长对话成本的影响。

  4. OpenAI News78

    OpenAI 发布 GPT-6 Sol 与 Luna 两款模型

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,二者在能力与成本上有不同侧重。

    推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同定位。

9月22日周二
  1. Latent Space78

    小米发布 MiMo-V2.6-Pro 1T-A42B 开源全模态模型,训练成本 300 万美元

    小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,称其为首位开源权重模型,输入 $0.435/M、输出 $0.87/M tokens,采用 MIT 许可。

    推荐理由:小米首次进入前沿开源模型序列,其 RL 训练成本与开源环境细节提供了观察后训练路线的新样本。

9月16日周三
  1. NVIDIA Blog62

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1 并取得领先性能

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf v6.1 首次提交给出 Vera Rubin NVL72 相对 GB300 的吞吐与扩展效率数据,可据此判断下一代推理平台的性价比走向。