51AllAI 精选专题

AI 视频生成专题

持续跟踪 AI 视频生成与编辑,比较输入方式、片长、分辨率、声音、角色一致性和 API 开放条件。

本专题关注什么

AI 视频工具可以从文本、图像或视频素材生成与编辑片段,部分产品还支持联合生成声音。选择工具时,应围绕实际任务比较,而不是把所有产品压缩成一个总排名。

重点检查六个维度:输入素材、单次片长、输出分辨率、声音能力、跨镜头一致性,以及失败后的局部修改方式。演示视频只能证明该样例效果,不能直接说明稳定成功率或真实制作成本。

官方资料入口

阅读与使用边界

同一模型的网页产品和 API 可能具有不同的时长、分辨率、排队与计费限制。涉及人物形象、商标、音乐和素材时,还需核对授权范围;AI 生成内容不应冒充真实现场记录。

更多图像、语音与跨模态报道见多模态分类,完整专题列表见精选专题

最新报道与时间线

按发布日期排列,保留每篇报道发布时的版本与适用范围。历史消息不代表产品当前状态。

  1. 阿里云正式上线 Wan3.0,API 首月限时七折

    阿里云正式上线 Wan3.0 视频生成模型,标准版 API 于 2026 年 8 月 24 日至 9 月 23 日限时七折。本文整理三档分辨率的原价与折后价、30 秒视频成本、计费方式和百炼接入要点,说明输入参考视频时如何计算总时长,帮助开发者避免低估实际调用费用。

  2. 阿里云开放 Wan3.0 公测,单次可生成 30 秒视频

    阿里云开放 Wan3.0 视频生成模型公测,单段视频最长 30 秒,并支持文字、图片、音频、视频及常见办公文档作为输入。本文整理当前可用入口、文档限制、参考生成和视频编辑方式,帮助普通用户判断如何选择入口并试用。

  3. MiniMax 发布 H3,支持多模态参考生成 15 秒 2K 音视频

    MiniMax H3 已开放视频生成 API,可统一接收文字、图片、视频与音频参考,输出 4 至 15 秒 2K 双声道音视频。本文整理三种生成方式、素材数量限制、异步调用流程,以及 2K 每秒 0.80 元的计费规则,帮助创作者和开发者按素材类型估算实际使用成本。

  4. 字节跳动发布 Seedance 2.5,单次生成 30 秒并支持定向编辑

    字节跳动正式发布视频创作模型 Seedance 2.5,单次可生成 30 秒视频,并支持多轮延长、最多 50 个图片视频音频参考素材和时间戳定向编辑。本文梳理主要变化,并说明如何通过即梦 AI 网页端和豆包专业版开始体验。

  5. Vivix 同天发布 Vivix-A1 与 Vivix-W1

    Vivix 同天发布 Vivix-A1 与 Vivix-W1,把实时交互引入 AI 角色和故事生成。本文说明两款模型的功能差异、语音与图像等交互方式、流式音视频机制、API 接入范围及当前公开限制,帮助开发者判断适用场景。

  6. Google 推出 Gemini Omni Flash,视频生成接入多模态输入

    Gemini Omni Flash 是 Google 新的多模态视频生成模型,支持文本、图片、视频和音频输入,并先落地 Flow、Gemini 和 YouTube Shorts。本文梳理可用渠道、编辑能力、内部评测口径和第三方验证缺口。

  7. 阿里灰度开放视频大模型 Happy Horse 1.0 API,登顶 Artificial Analysis 盲测双榜

    阿里视频大模型 Happy Horse 1.0 API 灰度开放,以 150 亿参数单流架构实现音画同步生成,在 Artificial Analysis 盲测中 Elo 评分达 1382,超越字节 Seedance 2.0 登顶文生视频与图生视频双榜。

  8. LibTV 平台接入 HappyHorse 1.0,实现原声音视频单流同步生成

    LibTV 平台正式上线 HappyHorse 1.0 视频音频生成模型,依托150亿参数统一架构首次在应用端打通视频画面与高保真音频的联合生成全链路,实现原声音频与视频画面的单流同步输出能力,彻底重构传统影视制作中的后期配音与拟音工作流。

  9. 字节跳动 Seedance 2.0 发布:AI 视频从「抽卡」迈向「工业化导演」

    字节跳动于 2026 年 2 月初低调上线的新一代视频模型,核心突破在于原生音画同步与多镜头叙事的一致性,标志着 AI 视频生成从“生成一段素材”进化为“导演一场戏”。 1. 原生音画同构与多镜头叙事 (Native A/V & Multi-Shot) Seedance 2.

  10. 可灵 AI 发布 Kling 3.0 模型,开启“AI 导演”工作流

    快手可灵正式迈入 Kling 3.0 时代,首创 AI 导演模式自动调度景别输出多分镜连贯片段,原生支持中日韩英西5种语言口型精准同步与多人场景定向发声,视频时长提升至15秒,Image 3.0 引入视觉思维链支持2K/4K分辨率原生输出。