世界模型迈入“有声时代”:24FPS画面+48kHz立体声实时生成

OpenAI·17 天前

近日,OpenAI宣布其世界模型技术取得重大突破,成功将视觉与音频生成能力深度融合。该模型能够以24帧每秒的速率实时生成连续视频画面,并同步输出48kHz采样率的高保真立体声音频,实现了“画面与声音一体生成”的沉浸式体验。

这一进展被视为多模态AI生成领域的关键里程碑。传统AI生成模型通常将视觉与音频处理分离,而此次技术突破通过统一的架构同步生成高质量视听内容,大幅提升了生成内容的真实感与连贯性。业内专家指出,该技术有望在影视制作、游戏开发、虚拟现实等领域带来革命性应用,同时也为通用人工智能(AGI)的发展提供了重要技术积累。

据悉,该模型的部分技术细节已通过论文公开,相关代码即将完全开源,预计将推动整个AI社区在多模态生成方向的快速发展。

世界模型多模态生成OpenAI实时生成AIGC

原文来源:https://www.qbitai.com/2026/08/474334.html

相关阅读

机器人迎来GPT-3时刻:看3秒演示即学新动作
Qwen3.8-27B 开源发布,家用显卡即可流畅运行
OpenAI AI 模型意外暴露,引发安全担忧
奥特曼亲自叫停最强模型Astra测试,OpenAI内部安全管控再引关注
ChatGPT免费版迎来重大升级,用户可无限使用GPT-4o模型

← 返回