SadTalker:学习现实的3D运动系数风格化音频驱动的单图像说话的脸动画。
摘要 通过人脸图像和一段语音音频生成说话头视频仍然存在许多挑战。例如,不自然的头部运动,扭曲的表情和身份修改。我们认为这些问题主要是因为从耦合的二维运动场中学习。另一方面,明确使用3D信息也会遇到僵硬的表达和不连贯的视频问题。我们提出了SadTalker,它可以生成3英寸的3D运动系数(头部姿势,表情)。
Moshi是一个实验性的会话AI,能够进行实时的语音对话。
该模型通过优化内存使用和减少推理延迟,极大提升了视频生成的效率。
一款无需训练即可实现视频重光照的工具,通过渐进光融合技术,能够快速生成高质量且光照一致的视频。
Mini-Omni是一款开源的多模态大型语言模型,支持实时端到端的语音输入和流式音频输出,能够在思考的同时进行语音交互。
一帧秒创是基于秒创AIGC引擎的智能AI内容生成平台,为创作者和机构提供AI生成服务。
VibeVoice-1.5B 是微软开源的文本转语音(TTS)大模型,可一次性生成 90 分钟高保真、多人轮替的长篇语音,并达到 3200 倍超高音频压缩率。
Moshi是一个实验性的会话AI,能够进行实时的语音对话。