跳到正文
10月4日 · 周日

最新精选

今天10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态而非回答给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测研究,用 507 个有状态工作流各跑 20 次,揭示单次成功率与稳定复现之间的差距。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的联邦学习系统,Gboard 已采用

    Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强且准确率提升。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已落地的训练提速与隐私保证细节。

9月25日周五
  1. Google Research62

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯长视频。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与十分钟级生成的评测结果。

9月24日周四
  1. Microsoft Research62

    微软研究院:把物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,能提升任务成功率、支持更大的模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。

9月4日周五
  1. Google Research62

    Google 与 HHMI Janelia 等发布雄性果蝇完整脑连接组图谱

    Google 与 HHMI Janelia 及剑桥大学等合作者发布雄性果蝇大脑与中枢神经系统的完整连接组图谱,成果发表于 Cell,论文题为《Sexual dimorphism in the complete connectome of the Drosophila male central nervous system》。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的雄性果蝇完整连接组,读者可了解 AI 如何把电子显微镜切片拼成全脑图谱。

8月28日周五
  1. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模流程压缩到数分钟。

    推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的基准对比,可了解自主地理空间建模的可行边界。

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过其全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化到 MXFP4 之后,直接蒸馏原始未压缩的全精度教师模型,而不是蒸馏恢复出的 bfloat16 checkpoint。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附与 QAT 的稳定性对比数据。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别基准优化现象可被量化

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。

    推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

8月13日周四
  1. Hugging Face Blog74

    Hugging Face 用智能体复现 ICML 2026 的 2200 余篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的三分之一。

    推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体分工。

8月12日周三
  1. Google Research71

    Google 研究将 AMIE 推进到实时视频问诊,达到专家级水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步进行诊断推理。

    推荐理由:Google 公布 AMIE 视频版在 300 场随机对照问诊中与初级保健医生评分相当,并给出多智能体架构与局限说明。

7月31日周五
7月23日周四
  1. Google Research62

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google Research 发布研究论文 SymptomAI,用五个 Gemini Flash 2.0 驱动的对话式智能体开展症状问诊与鉴别诊断(DDx),全国随机研究共纳入 13917 名参与者。

    推荐理由:Google 用 13917 人随机对照研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。

  2. Google Research62

    Google Research 提出从错误中学习的量子计算机纠错框架

    Google Research 在 Nature 发表论文,提出一种强化学习框架,让智能体从量子纠错检测事件中学习,在计算过程中持续调整数千个控制参数以对抗漂移。

    推荐理由:Google 用强化学习让量子纠错检测事件反过来指导控制参数校准,读者可了解量子计算连续运行的一条新路径。

7月15日周三
  1. Hugging Face Blog60

    Hume 发布 Real World VoiceEQ:衡量语音 AI 的人类质量

    Hume 发布 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个专有与开源语音模型、15+ 评估维度和 60+ 指标,涵盖 ASR、TTS、S2S 和语音理解。

    推荐理由:Hume 用超百万条人工评分构建语音 AI 基准,揭示传统指标为何高估真实对话表现。

7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 与 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态传感器信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用五百万人的万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。

7月8日周三
  1. Google Research62

    Google Research 在 10 座美国城市实测导航改道缓解拥堵

    Google Research 在 Nature Cities 发表研究,在 10 座美国城市通过修改 Google Maps 算法,将遇到预设拥堵路段的行程引导至耗时相近的替代路线,进行为期六个月的全市 switchback 实验。

    推荐理由:Google Research 在 10 座美国城市实测导航改道干预,给出了全网通行速度与排放的可量化变化。

6月8日周一
  1. Google DeepMind62

    Google DeepMind 公布塞拉利昂 AI 教学试验结果

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。

    推荐理由:原文给出塞拉利昂预注册试验的量化结果与交互数据,读者可据此判断 AI 辅助教学的实际效果与边界。

6月5日周五
  1. Google Research66

    Google 研究用手机摄像头实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。

    推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模多肤色 rPPG 数据集与预训练模型。

5月20日周三
  1. Google Research71

    Google 发布 ERA 科研工具并开放 Computational Discovery 访问

    Google 发布基于 Gemini 的科研工具 Empirical Research Assistance(ERA),可搜索文献、编写代码、组合方法并评估结果,相关成果已发表于 Nature。

    推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,读者可据此判断科研编码自动化的落地路径。

5月16日周六
  1. Google DeepMind62

    斯坦福团队用 Co-Scientist 筛选抗肝纤维化药物

    斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药。

    推荐理由:斯坦福团队用 Co-Scientist 筛选抗纤维化药物,实验显示其候选药优于人工挑选,可观察 AI 辅助药物重定位的实证效果。