微软 AI 发布面向语音智能体的转写与语音合成模型
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,微软称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
微软 AI 发布实时转写模型 MAI-Transcribe-2-Streaming,微软称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首个部分结果延迟略超 100 毫秒,年底前音频价格为每小时 0.54 美元。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量更高且对提示词的遵循和结构感知更好,人声更具表现力和情感细节、发音也更准确,同时可更便捷地控制输出的节奏与时长。