阿里推出的国内首个一站式AI语音生产力平台,基于Qwen-Audio模型,支持语音记录、智能体和音频内容创作三大功能
阿里巴巴推出的国内首个一站式AI语音生产力平台,基于自研语音模型Qwen-Audio打造,集成语音记录CosyFlow、语音智能体CosyAgent与音频内容创作CosyCreative三大核心能力,支持iOS、Android、Mac、Windows多端使用。
谷歌实时语音多模态模型,Search Live 全球上线,支持摄像头实时识别与低延迟语音对话,开发者可构建实时智能代理应用。
GPT-realtime 是 OpenAI发布的语音到语音模型,能够通过单个模型和 API 处理从音频输入到音频输出的全流程,为语音交互带来革命性突破。
Stable Audio 2.5 是 Stability AI 推出的最新音频生成模型,可在几秒内生成高质量、多段落结构的音乐,支持文本转音频、音频修复等多种创作方式。
Fun-Audio-Chat-8B 是阿里巴巴通义实验室开源的新一代端到端语音交互大模型,以双分辨率语音表征架构实现超低延迟与近 50% GPU 资源节省,兼具情感感知、语音指令执行、全双工交互等核心能力,性能逼近 GPT-4o Audio 与 Gemini 2.5 Pro,推动开源语音 AI 进入实用化新阶段。
美团开源音频生成大模型,首创波形潜空间建模,刷新音色克隆 SOTA,解决音色漂移问题。
Hume AI Voice Conversion:一次录音即可把“声音灵魂”完整移植到任意目标声线,实现带情感的跨语言、跨性别、跨风格语音转换。
谷歌实时语音多模态模型,Search Live 全球上线,支持摄像头实时识别与低延迟语音对话,开发者可构建实时智能代理应用。