据官方消息,美国初创公司 Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构的研究团队,近日发布了实时可交互音视频世界模型 HelixWorld 1.0,把"会动"的世界模型推进到了"有声有色"的新阶段。 在此之前,各类世界模型虽然能实时渲染画面、让你在其中自由走动探索,但一直是"有画无声"——画面再真实,也没有和场景同步的声音。HelixWorld 补上的正是这块短板:它支持 24 FPS 实时生成画面,同时输出 48kHz 双声道立体声音频,最关键的是,画面和声音由同一个原生 Transformer 架构从头绑定生成,不是视频做完再另配一条音轨。 换句话说,你在这个世界里往前走一步、转个身,画面和声音会一起跟随变化:离声源多远、踩在什么材质上、声音从哪个方向来,耳机里都能听出来;身后的脚步声、拐角外的碰撞声,往往耳朵比眼睛先捕捉到。用户每一次操作,都会同时作用在画面和声音两个模态上,实现声画同步的实时响应。 据了解,团队为了让声音和画面真正"同属一个世界",在数据处理、模型因果化、实时推理速度上都做了专门的工程打磨,把生成步骤压缩到实时可跑的范畴。接下来几周,HelixWorld 的模型权重和代码将完全开源(仓库已在 GitHub 公开),供开发者自由使用。 据公开资料,Noiz AI 组建于 2025 年底,成员来自 Meta、Google、Dolby、清华等机构,开源项目累计获得超 5 万 GitHub Stars。HelixWorld 的发布,也让人形机器人、自动驾驶、可交互游戏等依赖"实时世界模拟"的应用,看到了更逼真的落地可能。 来源:量子位(https://www.qbitai.com/2026/08/474334.html) |
业界动态英伟达AI服务器要涨价了:明年初交付,可能2026-08-24
业界动态具身大脑公司融资超10亿:中科第五纪在德国2026-08-21
业界动态宇树科技上市:中国机器人第一股开盘一度涨2026-08-20