智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1)。该模型采用智象自研原生全模态架构,支持文本、图片、视频等多种模态输入,可一键直出5至20秒1080p高保真视频,在意图理解、物理规律理解、自主规划叙事及音画一体化生成等维度全面升级。
发布同期,HD-V1在两项国际权威评测榜单中位居世界前列。在全球领先的独立AI基准测试与分析平台Artificial Analysis的Image to Video Leaderboard(With Audio)排行榜上,HD-V1取得全球第四;在全球AI模型盲测评测平台Arena.ai的Image-to-Video榜单中取得第八。图生视频是多模态领域技术密度最高、竞争最激烈的方向之一,HD-V1以双榜高位成绩完成全球首次亮相。
针对用户输入口语化、碎片化、模糊化易导致意图漏解、镜头跳戏、人物漂移与音画错位等问题,HD-V1前置多模态意图理解模块,对镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、景别构图、运镜焦段、台词与背景声等字段进行结构化规划,保证模型充分理解用户意图并转换为专业表达。
HD-V1的另一重要突破是更懂物理。物体在重力下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续,这些物理规律被理解并写入视频模型的叙事之中,成为画面生成的底层逻辑。智象未来CTO姚霆表示,视频生成的代际进化不仅在于像素提升和时长延续,更在于模型是否真正理解创作者意图和真实世界物理规律,HD-V1从架构设计之初便面向文本、视频与音频的统一表征。