智象发布原生全模态视频模型HD-V1,图生视频双榜进入全球第一梯队
智象未来发布首个原生全模态视频生成模型HiDream-O1-Video-1.0,支持文本、图片、视频输入,一键直出5–20秒1080p视频;Artificial Analysis图生视频(含音频)榜全球第四,Arena.ai图生视频盲测第8;同期宣布完成C+轮融资。
AI解读:智象未来把视频模型放进了它今年4月就铺开的世界模型矩阵里:图像、交互世界、具身三个方向此前已有模型,HD-V1补上视频这一环,官方称业内首个原生全模态世界模型闭环由此成型。对关注这家公司的人来说,这不是单点产品更新,而是路线图兑现节奏的信号。
真正决定用不用得上的,是它宣传的两个能力:一是先做多模态意图理解,把口语化提示词拆成镜头、角色、台词、音效等结构化规划;二是把物理规律写进生成逻辑,官方用例是红线受力形变、乒乓球弹跳声音随高度变化。这些演示由智象提供,三款模型对比的结论也来自官方,缺少第三方复现,实际效果仍需以自己手头的提示词验证。
榜单成绩目前是图生视频方向:Artificial Analysis含音频榜全球第四,Arena.ai盲测第8。双榜高位说明它进入第一梯队讨论有据,但两个榜单测的是图生视频单项,不等于模型在任意视频任务上都能排到这个位置。
音画一体化是另一个差异点。多数视频模型先出画面再后期配音,HD-V1对文本、视频、音频联合建模;如果实际可用,直接受益的是需要口型同步、环境声过渡的短视频和广告创作者,能省掉一遍对轨返工。不过5–20秒、1080p的规格也说明它暂时服务的是短镜头素材,不是整片生成。
C+轮由新微资本、交子资本、工银资本参与,量子位注明本文由智象未来提供并获授权转载,因此文中榜单名次、对比演示和融资评价均为公司口径。判断这条新闻的价值时,把发布信息和技术自证分开看会更稳妥:模型已发布、融资已公布是事实,能力排第几还需要自己测。
智象未来(HiDream.ai)2026年9月15日发布首个原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1),支持文本、图片、视频等多种模态输入,可一键直出5–20秒1080p视频。
双榜成绩:Artificial Analysis含音频图生视频第4,Arena.ai图生视频第8
据量子位获授权转载的智象未来稿件,HD-V1发布同期在两项国际评测榜单中位居前列:在Artificial Analysis Image to Video Leaderboard(With Audio)排行榜上取得全球第4;在Arena.ai Image-to-Video盲测评测中取得第8。
稿件称Artificial Analysis的图生视频榜单以标准化、可复现的基准对全球头部视频生成模型进行系统评测;Arena.ai Image-to-Video是专注于AI视频生成模型的盲测评测子平台。上述榜单描述与名次均出自智象未来提供的稿件。
技术路线:先理解意图和物理规律,再联合生成
HD-V1采用智象自研原生全模态架构。据稿件,模型前置多模态意图理解模块,对视频内容做结构化规划,字段包括镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、景别构图、运镜焦段、台词与背景声等,把用户口语化、碎片化的输入转换成模型可接受的专业表达。
物理规律方面,稿件称重力下落、碰撞反馈、惯性延续、光影衰减、空间连续性等规律既被理解,也被写进视频模型的叙事,作为画面生成的底层逻辑。官方给出的对比演示为红线受力形变:模型一出现红线向内缩短,模型二凭空生出一根针,HD-V1生成的红线随手的发力自然隆起并顺势延展。
技术思路被概括为“先规划、后联合生成、再以多模态Reward对齐”:先在全局层面规划叙事与角色状态,再在联合生成中约束画面、动作和语义,最后用多模态奖励信号对齐画质、连贯性与物理合理性。后训练阶段采用Diffusion Reinforcement Learning,并设计面向人工认知对齐的多模态Reward模型。
生成时长交给内容决定,音画在同一过程中对齐
多数视频模型按提示词中指定的固定秒数填充内容。HD-V1把时长决策交给内容本身,模型根据事件展开逻辑、动作完成周期、叙事推进节奏自行规划生成时长。稿件给出的对比是苹果抛接:前两款模型机械生成10秒,模型一在动作完成后从第3秒起让手继续握着苹果,模型二用慢放填补时长,HD-V1生成的人物抛出、接住、稳定手持节奏自然。
音画同步方面,稿件称多数视频模型采用先逐帧生成画面、再回头配音配效的后期拼接路线。HD-V1对文本、视频、音频信号联合建模,三者在同一生成过程中相互约束与对齐:画面运动牵引声音节奏,台词与音效反哺镜头情绪。对比演示为乒乓球在桌上弹跳,稿件称只有HD-V1生成的内容节奏符合物理规律,声音随高度变化而变化。
上述对比demo均来自智象未来提供的稿件。稿件未给出榜单评测与demo之外的第三方复现结果或公开效果数据。
世界模型闭环与C+轮融资
智象未来今年4月发布原生全模态世界模型架构HiDream-O1,随后基于同一架构发布模型家族。稿件列出的成绩包括:图像生成模型HiDream‑O1‑Image商用版1.5在Artificial Analysis文生图榜单取得中国第一、全球第二,开源版本也取得第二;交互式世界模型HiDream‑O1‑World在行业首个交互式世界模型基准WBench综合总榜第一;具身世界模型HiDream‑O1‑Embodied在RoboColiseum的扰动适应和空间推理子榜单登顶。随着视频模型发布,智象称业内首个原生全模态世界模型闭环成型。
在HD-V1发布之际,智象宣布完成C+轮融资,投资方为新微资本、交子资本、工银资本。稿件称新微资本由上海新微科技集团、上海科创投集团以及管理团队共同发起成立,管理基金规模近百亿元;交子资本为成都交子金控集团旗下全资国有股权投资平台,管理基金规模超1700亿元。
稿件引用智象未来CTO姚霆的说法称,HD-V1是智象原生全模态世界模型矩阵的关键组成部分,视频生成的代际进化不仅在于像素和时长,而在于模型是否真正理解创作者意图和真实世界物理规律;这次在两项榜单进入第一梯队,是对原生全模态技术路线最直接的验证。智象创始人梅涛称公司构建“一个原生全模态底座、四大模型同源演进”的模型矩阵。
信息边界
量子位在文末注明:本文由智象未来提供,量子位获授权转载,观点归原作者所有。因此稿件中的榜单名次、技术对比演示、产品性能描述和融资方评价均为智象未来口径,本文仅作转述。