跳到正文
Hugging Face 每日论文·· 2 天前AI 评分55

WorldSonus:为世界模型实时合成空间立体声的视频到音频框架

WorldSonus: Bringing Sound to Worlds

AI 导读

WorldSonus 提出面向世界模型的交互式视频到音频框架,用于实时空间声音合成。其采用流式因果自回归扩散架构,以 0.41 的低实时因子(RTF)生成音频块,并通过音频描述流水线与按块索引的提示调度实现生成中动态控制声音事件,同时用立体声与 ambisonic 数据做空间对齐监督。

来源:Hugging Face 每日论文 · huggingface.co