世界模型迈入“有声时代”:24FPS画面+48kHz立体声实时生成
近日,OpenAI宣布其世界模型技术取得重大突破,成功将视觉与音频生成能力深度融合。该模型能够以24帧每秒的速率实时生成连续视频画面,并同步输出48kHz采样率的高保真立体声音频,实现了“画面与声音一体生成”的沉浸式体验。
这一进展被视为多模态AI生成领域的关键里程碑。传统AI生成模型通常将视觉与音频处理分离,而此次技术突破通过统一的架构同步生成高质量视听内容,大幅提升了生成内容的真实感与连贯性。业内专家指出,该技术有望在影视制作、游戏开发、虚拟现实等领域带来革命性应用,同时也为通用人工智能(AGI)的发展提供了重要技术积累。
据悉,该模型的部分技术细节已通过论文公开,相关代码即将完全开源,预计将推动整个AI社区在多模态生成方向的快速发展。