商業動向
出版:2026-Aug-24 18:30
更新:2026-Aug-24 18:30

原生全模態路線進階,智象未來發佈交互式世界模型HiDream-O1-World

分享:

北京,中國 - 2026年8月24日 - 今日,智象未來(HiDream.ai)正式發佈HiDream-O1-World,一款原生全模態交互式世界模型。

原生全模態路線進階,智象未來發佈交互式世界模型HiDream-O1-World

HiDream-O1-World具備漫遊、編輯、交互三大功能,支援文字、圖像、交互等多模態輸入。用戶可一鍵生成時空一致、符合物理規律、可長時推演的完整世界。

模型搭載智象自研的原生全模態UiT(Unified Transformer)架構。升級後的UiT在交互式世界模型領域兩大核心挑戰——時空一致性與物理一致性上取得關鍵突破:鏡頭推拉搖移時,場景幾何結構保持穩定,物件不會消失或變形;碰撞、遮擋、重力響應高度符合真實世界的因果邏輯,而非隨機拼接的畫面。

智象未來CTO姚霆表示:「交互式世界模型的價值,不在於生成一個逼真的三維場景,而在於AI開始真正理解空間的深度、物件的質感、運動的慣性與光影的邏輯。這是對物理世界運行規律的系統性認知與重塑。HiDream-O1-World正是這場重塑的第一道橋樑——讓每一次交互,都通往一個從未抵達的世界。」

首次參評即登頂,刷新交互式世界模型上限

HiDream-O1-World近日在第三方評測WBench中交出首份成績。WBench由美團LongCat團隊與復旦大學聯合推出,是業內首個面向交互式世界模型的系統性評測基準,涵蓋289個多輪交互案例、1,058個交互輪次,基於五大維度、22項指標構建。

智象HiDream-O1-World在核心的Navi分榜以平均分80.9登頂,物理(Physical)維度73.3分位列第一,一致性(Consistency)維度達88.0分,綜合表現排名榜首,超越騰訊混元1.5、阿里快樂生蠔等主流模型。Navi分榜聚焦空間導航與視角控制,被業界視為衡量世界模型空間理解能力的核心標尺。首次參評即登頂,刷新交互式世界模型性能上限。

一鍵生成世界,開啟沉浸式交互體驗

模型支援文字、圖像、交互式操控等多模態輸入,用戶只需一段描述、一張圖片或簡單操控,即可一鍵生成結構完整、風格多元的交互世界。例如上傳一張室內照片,模型便能快速構建高精度數碼孿生空間,自動補全整間臥室全景圖——比例精準、細節豐富。

模型提供第一人稱與第三人稱兩種漫遊視角。以潛水場景為例,視角移動時水面光影與海底碎光同步變幻,珊瑚礁色彩分明、魚群游弋自如,拉近後珊瑚紋理清晰可見,全程穩定無漂移。

不止漫遊,模型還支援實時編輯——驅動角色完成抓取、奔跑、下蹲、跳躍等動作,或觸發降雨、物件墜落等環境事件。所有變動基於幾何、光照、材質到物理邏輯的全局統一,確保每次交互都自洽。

模型具備強大泛化能力,支援人類、動物、虛構角色等,精準適配各角色形態與運動。以登雪山場景為例:腳印在雪面壓出真實凹陷,雪花隨風飄落緩急有致,遠處群山輪廓與腳下岩石紋理隨視角推移自然銜接。場景風格涵蓋真實城市街景、自然地貌、室內空間,以及幻想異世界、二次元卡通、3A遊戲級渲染。

兩大核心突破:長時程時空一致性與物理一致性

交互式世界模型長期受制於空間、物理與記憶三大難題:視角切換引發畫面漂移與結構紊亂;物理違和(穿牆、懸浮)折損可信度;缺乏長效記憶導致物件消失。HiDream-O1-World透過UiT架構實現關鍵突破,核心在於兩大協同能力:

長時程時空一致性。模型將「3D先驗注入Memory上下文」與「Test-Time Training(TTT)在線維護」協同設計。Memory機制將場景幾何結構與物件空間關係編碼為3D先驗,讓模型在多輪視角切換中「記住」已探索結構,從根本規避漂移與場景「重置」。TTT在推理階段進行輕量級在線自適應,動態優化適配器,使內部表徵與場景3D約束持續對齊。傳統模型如同「畫師逐幀作畫」,微小偏差不斷放大;HiDream-O1-World則如一位擁有「空間記憶」的導演,在Memory中記錄結構,鏡頭移動時調取對應視角,而非每步重新揣測環境。

全局穩態物理一致性。訓練端,生成式世界模擬器產出涵蓋剛體碰撞、流體運動、柔性形變、重力拋射等的合成數據,強化模型歸納偏置;推理端,同一TTT機制在線增強物理一致性,當新物件或材料出現時動態調整表徵。雙輪驅動設計帶來實質突破——視覺合理性評測較行業平均提升13.6%,因果保真度評測提升12.7%。

這一技術路線獲國際頂會認可。相關論文入選ECCV 2026(歐洲計算機視覺國際會議,全球計算機視覺與AI領域三大頂級學術會議之一)。

論文:DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
項目主頁:https://yanghb22-fdu.github.io/DreamWorld

三大產業新格局

AI互動影遊。用戶不再被動跟隨線性劇情,而是敘事的主動參與者,世界隨探索沿不同分支劇情演進,在影視級視覺質感中獲得前所未有的沉浸感,享受多重結局。

具身智能仿真。模型可高效搭建遵循物理規則的城市、工廠、室內等仿真空間,為機器人訓練、自動駕駛、智能製造提供虛擬試驗底座,替代高成本、高風險的實景測試。

3D場景生產。面向創作者與設計師,模型可生成3D手辦、家居場景及藝術空間,支援結構微調與風格切換。更具想像空間的是向微觀世界延伸——精準模擬細胞行為、蛋白質相互作用,為藥物發現與疾病機理研究開闢數碼仿真新路徑。

當物理世界可被一鍵生成、自由交互,許多行業都值得被重新想像。這些領域還只是冰山一角——隨著開發者與創作者不斷加入,交互式世界模型的應用邊界將遠超今天所能描繪的範圍。

ADVERTISEMENT

ad

恭喜你!獲取1分 !

更多積分任務