支援文字、圖片、影片等多模態輸入,可生成5至20秒1080p音畫一體化视频;首次參與兩項國際獨立評測即躋身全球前列
北京,中國 - 2026年9月17日 - 全球大模型技術創新公司智象(HiDream.ai)正式發佈原生全模態视频生成模型HiDream-O1-Video-1.0(簡稱「HiDream V1」)。該模型以創作意圖與物理規律理解為核心,支援文字、圖片、影片等多模態輸入,可生成5至20秒1080p高保真影片,並在敘事規劃、人物一致性、物理合理性與音畫同步等方面實現全面升級。
發佈同期,HiDream V1首次參與兩項國際獨立模型評測:在Artificial Analysis Image to Video Leaderboard(With Audio)中位列全球前四,在Arena.ai Image-to-Video盲測排行榜中位列第八,躋身全球视频生成模型第一梯隊。
國際雙榜首秀,躋身全球影片生成第一梯隊
Artificial Analysis透過標準化、可複現的基準測試,對全球主流AI模型進行獨立評估;Arena.ai則透過匿名比較與用戶投票,對不同模型的生成結果進行盲測。兩類評測機制分別從標準化測試與真實用戶偏好兩個角度,為影片生成模型的綜合能力提供第三方參考。
HiDream V1首次參與兩項評測即取得全球前列成績,體現其在畫面質素、指令遵循、動態表現、敘事連貫性與音畫協同等方面的綜合競爭力。值得一提的是,全球AI视频生成賽道競爭激烈,Seedance、MiniMax H3等中國團隊開發的模型已持續位居國際排行榜前列;HiDream V1首次參評即躋身前列,令中國力量在這一領域的陣容進一步壯大。
智象未來CTO姚霆表示:「影片生成的代際進化,不只是解像度的提升與時長的延伸,更重要的是模型能否真正理解創作者的意圖,以及真實世界中的物體、動作與聲音如何相互作用。HiDream V1從架構設計之初便面向文字、影片與音訊的統一表徵,推動影片生成從『看得清、動得順』,進一步走向『聽得懂、演得連貫、音畫相一致』。此次在兩項國際獨立評測中進入全球前列,是對智象未來原生全模態技術路線的階段性驗證。」
畫面高保真、敘事連貫性、人物一致性全面升級
針對高保真畫質、敘事連貫性與人物一致性等關鍵指標,HiDream V1實現全面優化升級。它不只追求單格畫面的精美,更要令影片內容在整體敘事維度上自洽。
人物、情緒、動機、物理規律一旦進入連續鏡頭,便必然互相影響。為此,智象提出「先規劃、後聯合生成、再以多模態Reward對齊」的技術思路,讓模型先在全局層面規劃敘事與角色狀態,再在聯合生成中約束畫面、動作與語義,最後以多模態獎勵訊號對齊畫質、連貫性與物理合理性。
原生全模態,更懂意圖與物理規律
影片生成的核心挑戰,正從單格畫質轉向對複雜意圖、連續動作與真實世界規律的綜合理解。
用戶的影片創作指令通常包含人物、動作、場景、鏡頭、對白與聲音等多層資訊。為提升複雜指令的執行效果,HiDream V1引入多模態意圖理解與規劃機制,在生成前對用戶需求進行結構化分析,統籌鏡頭時長、場景、角色狀態、動作表情、景別構圖、運鏡方式、對白與環境聲等要素。
基於「先理解、再規劃、後生成」的技術路徑,HiDream V1能夠從全局層面規劃敘事與角色狀態,並在生成過程中協調畫面、動作、語義與聲音,提升內容完整性、人物一致性與鏡頭連貫性。
物理規律理解是HiDream V1的另一項核心能力。模型將重力、慣性、碰撞、形變、材質、光影與空間連續性等因素納入生成邏輯,令物體運動、角色動作與環境回饋更符合真實世界規律。影片生成由此不再只是對視覺表象的模擬,而是進一步建立對動態世界運行方式的理解。
讓敘事內容決定影片時長
現時多數影片生成模型以預設時長為生成條件,內容需要遷就固定的時間窗口,容易出現動作結束後畫面繼續停留,或以慢動作延長內容等問題。
HiDream V1將時長納入敘事規劃,根據事件發展邏輯、動作完成週期與內容節奏,在5至20秒範圍內自主匹配生成時長。其核心並非簡單增減格數,而是讓影片長度服務於內容表達,使動作推進與敘事節奏更自然、完整。
這一機制意味着,用戶不必預先判斷內容需要多少秒,而可以更專注於描述希望表達的事件與結果,由模型自主規劃相應的時間結構。
文字、影片與音訊聯合建模
傳統AI视频生成通常採用「先生成畫面、後添加聲音」的分階段路徑,容易造成口型、動作、環境聲與物理音效之間的錯位。
HiDream V1採用原生全模態架構,對文字、影片與音訊訊號進行聯合建模,令三類資訊在同一生成過程中相互約束、協同生成。畫面運動影響聲音節奏,對白與音效參與鏡頭情緒塑造,文字條件貫穿整體生成過程,從而提升人物表達、環境變化與物理動作之間的同步性。
在後訓練階段,智象未來採用Diffusion Reinforcement Learning,並構建與人類認知及審美偏好對齊的多模態Reward模型,從畫質、語義、動作、物理合理性與聲音等多個維度對生成結果進行綜合評估,進一步提升影片整體的一致性與真實感。
世界模型閉環成形:從單點能力到原生全模態矩陣
HiDream V1並非一項孤立的模型發佈,而是智象原生全模態世界模型體系的關鍵組成部分。
基於UiT(Unified Transformer)統一底座,智象未來已形成四大模型產品線:
- HiDream-O1-Image:面向圖像理解與生成;
- HiDream-O1-Video:面向動態內容生成與時間敘事;
- HiDream-O1-World:面向三維環境模擬與實時交互;
- HiDream-O1-Embodied:面向具身智能的空間推理、動作規劃與回饋。
早前,HiDream-O1-Image商用版1.5曾在Artificial Analysis文生圖排行榜中位列全球第二、中國第一,其開源版本亦曾位列該排行榜第二;HiDream-O1-World曾在交互式世界模型評測基準WBench綜合排行榜中位列第一;HiDream-O1-Embodied曾在RoboColiseum的擾動適應與空間推理分項排行榜中取得第一。
智象創辦人兼CEO梅濤博士表示:「我們所構建的,不是四條彼此獨立的模型產品線,而是一套以統一技術架構為底座、面向真實世界持續演進的原生全模態體系。下一代大模型的競爭,不僅取決於單項能力的提升,更取決於不同模態能否在統一架構下實現共同理解、生成與交互。」
從理解世界、生成世界,到模擬世界、作用於世界,智象未來原生全模態世界模型閉環由此進一步成形。
C+輪融資落實,國資產業資本聯手加碼
在HiDream V1發佈同期,智象宣佈完成C+輪融資,本輪投資方包括新微資本、交子資本與工銀資本。本輪融資將用於原生全模態模型研發、產品迭代、算力基礎設施建設及行業應用拓展。
新微資本由上海新微科技集團、上海科創投集團及管理團隊共同發起成立,管理基金規模近百億元(人民幣)。作為新微集團的企業風險投資平台(CVC),新微資本持續加強在人工智能領域的投資佈局,並依託新微集團在集成電路特色工藝製造領域的產業基礎,推動人工智能基礎設施、模型技術與終端應用協同發展。
交子資本是成都交子金融控股集團旗下全資國有股權投資平台,也是成都建設西部金融中心的重要產業資本載體。該機構聚焦人工智能等硬科技領域,透過長期資本與產業資源推動科技成果轉化與產業生態建設。
隨着HiDream V1正式發佈,智象從原生全模態走向世界模型的技術路線,正從戰略藍圖轉化為由統一底座、模型矩陣與產品能力共同支撐的現實體系。
HiDream V1目前處於內部測試階段,計劃於近期開放使用。可透過以下連結體驗:https://hiharness.ai/







