微软 AI 发布面向语音智能体的转写与语音合成模型
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,微软称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,微软称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
AI 音乐平台 Suno 上线语音生成功能 Speech,目前以公开测试形式在网页端和移动端开放,可根据脚本或提示词生成人声,并同时生成配套背景音乐。该功能提供 Simple 和 Advanced 两种模式,Advanced 可自定义脚本并调整 AI 声音性别、语音风格和生成多样性,单条语音最长约 8 分钟,背景音乐可通过开关关闭。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
OpenAI 在 API 中推出 GPT-Live-1,为开发者提供自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色和电话通信。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式变化。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步进行诊断推理。
推荐理由:Google 公布 AMIE 视频版在 300 场随机对照问诊中与初级保健医生评分相当,并给出多智能体架构与局限说明。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量更高且对提示词的遵循和结构感知更好,人声更具表现力和情感细节、发音也更准确,同时可更便捷地控制输出的节奏与时长。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体表现更好。
推荐理由:Google DeepMind 公开 AI co-clinician 研究计划,给出医生端与患者端两类评测结果,可了解医疗 AI 当前能力边界。