Black Forest Labs 发布 Flux 3 Image,支持多步局部编辑
Black Forest Labs 发布 Flux 3 模型家族的图像部分 Flux 3 Image,官方称其支持多步编辑且不改变画面其他区域,覆盖文生图、图生图、文字渲染和写实生成。
推荐理由:Flux 3 Image 支持多步局部编辑并给出免费试用与 API 折扣,可据此判断其与同期图像编辑模型的差异。
Black Forest Labs 发布 Flux 3 模型家族的图像部分 Flux 3 Image,官方称其支持多步编辑且不改变画面其他区域,覆盖文生图、图生图、文字渲染和写实生成。
推荐理由:Flux 3 Image 支持多步局部编辑并给出免费试用与 API 折扣,可据此判断其与同期图像编辑模型的差异。
AI2 发布 Olmo-core 3,这是其大语言模型训练框架的一次重大升级,重新设计了开放的 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出了 MoE 训练栈的吞吐与显存对比数据,读者可据此判断万亿参数 MoE 训练的开源方案成熟度。
Google 发布新前沿模型 Gemini 4 Argon,在多项基准上缩小与 OpenAI、Anthropic 的差距,但未取得明显领先。该模型先向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才面向开发者、企业和消费者,推广价输入 $2/百万 token、输出 $10/百万 token,缓存输入便宜 95%。
推荐理由:汇总第三方基准与定价数据,读者可据此判断 Gemini 4 Argon 与 OpenAI、Anthropic 前沿模型的差距和成本位置。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与内部部署数据,并列出评测机构与观察者的质疑,便于对照判断其真实水平。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准成绩和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
Google DeepMind 发布 SynthID Bio,把水印技术引入合成生物学,将不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物学,读者可了解其在 DNA 合成筛查与数据库标注中的验证层作用。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 NVIDIA Kumo Structured 模型集合,已在 Hugging Face 上线。
推荐理由:原文给出表格基础模型的架构、训练数据来源与四个基准排名,可据此判断免训练表格预测的可用边界。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨模态生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。其标准 API 输入与输出 token 价格为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,给出与 Astra 的能力定位和五分之一价格对比,可据此判断成本与适用场景。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。
推荐理由:汇总 Opus 5.5 发布一周内社区实测与榜单表现,并梳理 Jev、Perplexity Photon 等同期动态,便于快速把握当周模型与工具格局。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。
推荐理由:作者用同一套鹈鹕提示词实测新 Sonnet,并对比免费层能力,可据此判断性价比与可用性。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它与 Opus 5.5 的分工。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机智能体的成本与能力边界。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、表情和自然轮次切换的视觉化对话。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级多模态智能体的落地形态。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 的定位差异、语音克隆与逐行导演能力,以及基准排名和开放入口。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:同日两家发布新模型并同步降价,读者可对比能力、定价与 token 消耗之间的取舍。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者认为新一轮价格战已经开启。
推荐理由:作者实测并列出各家新模型价格表,读者可据此判断这一轮降价对智能体长对话成本的影响。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,二者在能力与成本上有不同侧重。
推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同定位。
小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,称其为首位开源权重模型,输入 $0.435/M、输出 $0.87/M tokens,采用 MIT 许可。
推荐理由:小米首次进入前沿开源模型序列,其 RL 训练成本与开源环境细节提供了观察后训练路线的新样本。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交给出 Vera Rubin NVL72 相对 GB300 的吞吐与扩展效率数据,可据此判断下一代推理平台的性价比走向。