咨询热线

0335-7830692

平台公告: 九游会j9.com致力于为用户打造高品质互动影视体验,依托专业团队与先进技术持续创新发展
NEWS 行业动态

Phone 0335-7830692

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

浏览次数:    时间:2026-08-19 13:31:47

  但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成(图1)

  放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。

  你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不到一丝铰链摩擦的声响;你看到野兽就在不远处低吼,身躯清晰映入眼帘,耳边却一片死寂。

  Noiz AI联合来自香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,刚刚发布了实时可交互音视频世界模型HelixWorld 1.0。

  你不再坐着看。往前走、转个身,画面和声音会同时跟上。你走到哪,世界就延伸到哪。

  离多远、踩在什么材质上、从哪个方向来,都会让它不一样;身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。

  参数也相当硬核,HelixWorld支持24 FPS实时生成画面,同时输出48kHz双声道音频。

  真正关键的还在后面。画面和声音由原生Transformer架构统一生成,从一开始就绑在一起,不会等视频做完再另配一条音轨。

  声画一起生成,声音跟着场景转,还能实时交互,是HelixWorld和现有方案不同的地方。放进现在可交互世界模型的对照里,会更清楚:

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成(图2)

  好戏才开始。接下来几周,HelixWorld的模型权重和代码将完全开源。(详见后续章节)

  数据决定上限。世界模型能走多远,很大程度上取决于它训练时见过什么样的世界。

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成(图3)

  视觉侧已有成熟解法,可以用位姿估计模型反推每一帧的相机轨迹,生成动作标签。可一到声音侧,几乎没有现成数据可用。

  现有技术报告通常会筛分辨率、时长、镜头切换等等,却很少管声音。道理很简单,它们本来就没打算生成有声世界。

  但音视频世界模型还得弄清更多事:音轨是不是现场录制,声源在哪,听者转身后声场怎么变,空间会留下多久回响。

  镜头持续移动,环境声同期录制,声画天然对齐。反射、遮挡、材质这些空间信息都来自真实环境,这一批主要用来保真。

  游戏世界则补上精确的空间关系。游戏引擎同时模拟视觉和听觉,几何、材质、声源位置和听者朝向都是已知的。距离衰减、墙体遮挡这些也有明确规则,每一声都能对上物理位置。

  原始素材还得再洗一遍。视觉侧按镜头切片,去掉九游会剪得太碎、运动太少、画质太差的,台标、水印、字幕也滤掉。

  音频侧没有现成经验,团队就自己搭清洗流程:去掉左右声道完全相同的伪立体声,清掉和画面对不上的后期配乐,再用语义筛选去掉旁白和外加音效,只留现场声。

  留下的片段还要做声画对齐校验。系统逐帧计算声像位置和左右声道能量,再和画面里的声源方位、事件时刻逐一比对。

  汽车从画面右侧驶向左侧,声像就该同步从右滑到左;碰撞发生在哪一帧,音轨上的能量峰值也得落在那一帧。空间对不上、时间错开的,直接丢掉。

  标注也不再只盯着画面。除了带真实尺度的相机位姿和视频描述,每段素材还会加上音频描述与音视频联合描述,把声音和画面里的声源对应起来。画外声则单独记下,免得模型自己编。

  走完整条管线后,团队得到百万量级训练片段,音质、立体声和帧级对齐都达标。随后再用人工标注数据训练分类器,按声画配合度与声场空间感打分,筛出高质量微调子集。

  音频和视频保留各自的latent表征,但会进入同一套Transformer联合生成,并持续交换信息。

  人往前走一步,透视、遮挡和声源距离都得变;人一转身,整个声场也得跟着转。原来在正前方的声音,转到侧后方,这才算真转过身了。声画有一路没跟上,沉浸感马上就破功了。

  这一阶段仍采用全序列可见的双向模型,先不追求实时。团队先把动作控制和联合生成做准,再来攻速度。

  关键不只是模型能不能动,还要看脚步有没有踩对材质、混响是否匹配空间大小、声源方位会不会跟着视角转。动起来还不够,得动得像那么回事。

  最基础的一关,是事件发生时声音必须同步出现,回响也要符合空间和动作。循环BGM、素材库音效和事后贴轨造成的伪同步,都要排除。

  空间关系不能只凭耳朵觉得像。画质有FID、FVD,音质有FAD,音画同步有Desync,声音的方位和距离对不对得上画面,一直缺自动化标尺。听着差不多还不够,位置必须对上。

  到这里,HelixWorld已经能让声画一起响应动作,但训练阶段的模型仍依赖“未来信息”,还无法真正实时交互。

  传统视频扩散模型采用双向生成。计算第10帧时,它可以参考第20帧,因此更容易保持连贯。

  可在交互世界里,第20帧还没发生,用户下一秒往哪走也不知道,没法提前看后面的帧。

  HelixWorld因此将双向预训练模型改造成因果模型,只允许它查看过去。同时通过KV Cache复用已计算的历史信息,逐块自回归生成,持续输出音频和画面。

  训练时,模型看到的历史干净且正确;部署时,它看到的是自己刚生成的结果,误差早已混在其中。

  如果模型始终拿这些数据训练,上线后就会拿着错答案继续作答。小误差一路滚,最后就是声画双双跑偏。

  团队的解法很直接:训练时就让模型读自己生成的历史,再去预测正确结果,提前练习带着误差继续往下走。

  这一步让模型从生成一小段,迈向持续生成。但能一直跑,还不等于能实时跑。几十步去噪依然太慢,用户按下方向键后,留给声画响应的只有几十毫秒。

  最后一关是速度。团队要把原本几十步的去噪压到个位数,同时省掉文本条件引导带来的额外前向计算。

  优化过头之后,高光溢出、色彩过饱和、暗部细节没了,画面看着更亮,其实已经失真。

  轨迹蒸馏让学生模型沿着教师模型的去噪路径走,给少步生成一个比较稳的基线。DMD负责守住最终分布,避免步数压下去之后偏离教师模型。

  再配合因果化后的KV Cache和逐块生成,动作输入、联合生成与音视频输出被串成连续流水线。

  至此,模型终于跨过实时门槛。画面与声音边生成边输出,用户的每一次操作,都能立刻得到回应。

  HelixWorld的权重和代码,将在接下来几周完全开源,把整套技术摊开来给全世界分享。

  巧的是,开源这边又热闹起来了。不久前Meta也重新回到了开源群,扎克伯格回心转意:限制开源是大错特错。

  创始人陈伟嘉(Vega)在Meta主导Yann LeCun(杨立昆)团队ASR模型落地,当时公司93%以上代码都是开源的;后来还开源出过很火的Mockingbird。

  首席科学家田泽越(Zeyue Tian)作为作者开源过AudioX、YuE等工作,其中ChatMusician还被杨立昆转发过。

  目前模型的API已经在内测中,团队在应用侧也正在悄悄搭建一个全新的交互内容社区,并从创作者和用户中源源不断获取宝贵的使用数据和反馈。这些都是更实打实的底气。

  HelixWorld 1.0,是Noiz AI对世界模型下一形态的回应:视觉从成片走向实时漫游,声音也正成为更关键的一环。

  开源,更多是希望生态更丰富一点。模型被拆开、复现、接到更多系统里,全行业一起跑,后面那一页也能更早到来。

  今天,大多数多模态模型还是围着Prompt转:输入一句话,完成一次生成,任务就结束了。

  但真实世界不会因为Prompt结束就停住。环境还在变,人还在动,新事件也还在发生。世界模型得一直跑着,不能用完就关机。

  它得知道正在发生什么,记得已经发生过什么,并对接下来的变化即时作出反应。

  每个角色都有自己的身份、目标和记忆,彼此可以协作,也可能起争执。故事不会完全按剧本走,更多是角色碰上之后自己发展出来。

  当人和智能体同时进到一个空间,模型得听清说了什么,还得分清谁在说、对谁说、声音从哪来。

  抢话、停顿、眼神这些,都可能把下一秒的关系带偏。把所有人的声音收进来只是门槛,难处在于读懂整个现场。

  如果世界要跑上几小时、几天,甚至更久,角色还得记得自己是谁,昨天推开的门今天得还开着,一次对话和一个决定也得真的留下痕迹。

  到这一步,一致性就不止人物不变脸、场景不乱漂。身份、记忆、空间状态和因果关系都得接得上,世界得有自己的历史。

  未来就算没有新的Prompt,也没有人在场,世界还能按自己的规则跑下去。

  角色会结成新关系,城市和资源也会继续变。你开口,世界会回应。你转身离开,里面的故事仍在继续发生。