扬声·CNDoor.Vip 首页 资讯 业界动态 查看内容

世界模型进入"有声时代":HelixWorld 1.0 让画面和声音一起实时生成 ...

2026-8-18 07:10| 发布者: 糖糊碌| 查看: 19| 评论: 0

摘要: 据官方消息,美国初创公司 Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构的研究团队,近日发布了实时可交互音视频世界模型 HelixWorld 1.0,把"会动"的世界模型推进到了"有声有色"的新阶段。 在 ...

HelixWorld 1.0 配图

据官方消息,美国初创公司 Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构的研究团队,近日发布了实时可交互音视频世界模型 HelixWorld 1.0,把"会动"的世界模型推进到了"有声有色"的新阶段。

在此之前,各类世界模型虽然能实时渲染画面、让你在其中自由走动探索,但一直是"有画无声"——画面再真实,也没有和场景同步的声音。HelixWorld 补上的正是这块短板:它支持 24 FPS 实时生成画面,同时输出 48kHz 双声道立体声音频,最关键的是,画面和声音由同一个原生 Transformer 架构从头绑定生成,不是视频做完再另配一条音轨。

换句话说,你在这个世界里往前走一步、转个身,画面和声音会一起跟随变化:离声源多远、踩在什么材质上、声音从哪个方向来,耳机里都能听出来;身后的脚步声、拐角外的碰撞声,往往耳朵比眼睛先捕捉到。用户每一次操作,都会同时作用在画面和声音两个模态上,实现声画同步的实时响应。

据了解,团队为了让声音和画面真正"同属一个世界",在数据处理、模型因果化、实时推理速度上都做了专门的工程打磨,把生成步骤压缩到实时可跑的范畴。接下来几周,HelixWorld 的模型权重和代码将完全开源(仓库已在 GitHub 公开),供开发者自由使用。

据公开资料,Noiz AI 组建于 2025 年底,成员来自 Meta、Google、Dolby、清华等机构,开源项目累计获得超 5 万 GitHub Stars。HelixWorld 的发布,也让人形机器人、自动驾驶、可交互游戏等依赖"实时世界模拟"的应用,看到了更逼真的落地可能。

来源:量子位(https://www.qbitai.com/2026/08/474334.html)


鲜花

握手

雷人

路过

鸡蛋
扬声 · CNDoor.Vip 汇聚 AI 资讯、办公效率、写作、图鉴等实用内容,为新手提供从入门到上手的 AI 指南。我们相信:AI 不该只是技术圈的事——把复杂的事说人话,让每个人都用得上。
  • 手机博客
  • 手机扬声
Copyright © 2014-2026 扬声 · 菜鸟门 版权所有 All Rights Reserved. 冀ICP备2025120842号
关灯 返回顶部
返回顶部