Cohere 发布的 20 亿参数开放语音识别模型,支持 14 种语言与 API、自托管、Model Vault 交付;导入时应实测口音、噪声、专有名词和未内置的时间戳与说话人分离需求。
Tag
voice-ai
包含该标签的简调共 6 篇。
GPT-Live 为 ChatGPT Voice 提供自然语音轮替、任务发起、进度检查与持续调整能力。
微软研究院面向低资源语言推出的语音模型与评测体系,以 PazaBench、社区测试和模型微调连接数据、指标与真实使用环境。
老牌 AI 陪伴应用,主打可定制虚拟伴侣、文字/语音/视频对话、记忆和订阅功能。
Mistral AI 发布的 4B 参数文本转语音模型,支持 9 种语言、低延迟 streaming、zero-shot voice cloning,并面向企业 voice agent 工作流。
面向创作者、开发者和企业的生成式音频平台,覆盖文本转语音、语音克隆、语音转文字、配音、音乐与音效,以及可部署的语音和聊天 agent。