电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问
混元文生视频

混元文生视频

混元文生视频 AI视频生成 腾讯混元

腾讯混元AI视频生成

官方网址:http://aivideo.hunyuan.tencent.com

广告

腾讯混元文生视频是腾讯推出的视频生成模型,输入一段文字描述,生成一段视频。它最受关注的一点是开源:2024 年 12 月上线时,腾讯把 130 亿参数的模型权重和推理代码一并公开,是当时参数量最大的开源视频生成模型。喜欢折腾的开发者可以自己部署和微调,普通用户则通过腾讯的产品入口直接使用。

基本介绍

混元文生视频由腾讯混元大模型团队开发,2024 年 12 月 3 日上线,是腾讯混元在文生文、文生图、3D 生成之后的新能力。模型采用全注意力 DiT 架构和自研 3D VAE,主打写实画质、语义遵从、动态流畅和原生转场,一次生成 5 秒、1080p 的片段,标准模式下生成一条大概需要 120 秒。

发展历程

2024 年 12 月 3 日,腾讯混元正式上线视频生成能力,并开源 HunyuanVideo,参数量 130 亿,包含模型权重、推理代码和模型算法,个人和企业开发者可以免费使用和开发。上线时以文生视频为主,腾讯方面表示后续不排除增加更高分辨率、图生视频和自动配乐等能力。此后团队继续迭代,推出了参数量更小的版本,用更少的算力达到接近的效果。

核心功能

  • 文生视频:输入文字描述生成 5 秒、1080p 的片段,支持中英文提示词。
  • 原生转场与切镜:5 秒内可自动切换镜头,并保持同一主体一致。
  • 连续动作:一次完成多个连续动作,运动符合物理规律。
  • 多种预设风格:写实、动画、电影、黑白、赛博朋克等可选。
  • 视频配音:端到端自动生成与画面匹配的声音,鸟鸣、水流、发动机、脚步声等音效可自动补上。
  • 动作与表情驱动:捕捉人体细微动作和表情并转化为驱动信号,卡通形象也能复刻表情。
  • 语音驱动:用语音驱动形象,配合肢体动作和口型。
  • 开源与微调:提供完整模型,可在开源社区下载并针对特定风格或主体微调。

适用人群

  • 开发者与研究者:需要可本地部署、可微调的视频模型。
  • 影视与广告前期:用生成片段做概念验证和分镜预演。
  • 国风与文创创作者:敦煌、古风这类东方题材的表现是它的长项。
  • 企业技术团队:通过云服务接入,把视频生成嵌进自己的产品。

使用方式

普通用户可以通过腾讯的产品入口申请试用,在 AI 视频板块输入提示词生成。开发者可以从开源社区下载模型自建服务,也能通过腾讯云按调用量接入。提示词写得结构化一些效果更好,把主体、场景、运动、镜头语言和氛围依次交代清楚,比一句话概括更容易出稳定的结果。

局限与注意

单条视频固定为 5 秒左右,做完整叙事要靠多段拼接,衔接处需要自己处理。腾讯方面解释过,时长受算力成本制约,属于优先满足常见需求的取舍。写实风格是它的强项,在风格化程度很高的题材上余地有限。涉及真实人物或知名 IP 形象的生成会被限制,以免侵权。自己部署开源模型对显存和运维有要求,不是拿一台普通电脑就能跑起来的事。

常见问题

混元文生视频真的开源吗?是,130 亿参数版本的模型权重、推理代码和算法都对外公开,个人和企业开发者可以免费使用。

一条能生成多长?上线版本以 5 秒为主,支持切镜,长度是按算力成本权衡后的结果。

能在自己电脑上跑吗?开源版本可以自行部署,但对硬件有要求,也需要一定的运维能力;不想折腾的话走云服务更省事。

相关导航

同一个方向还可以一并看看讯飞绘镜、剪映网页版、海螺AI,各自擅长的环节不太一样。

内容反馈
确认删除?
会员
教程
收藏
足迹
联系
  • 站长微信
顶部