首页
看点啥
插画图片
首页 看点啥 Wan-Dancer - 阿里通义开源的人像音乐驱动舞蹈视频生成模型

Wan-Dancer - 阿里通义开源的人像音乐驱动舞蹈视频生成模型

2026-07-20 0

Wan-Dancer快速摘要

Wan-Dancer是阿里巴巴通义实验室于2026年7月公开发布的人像音乐驱动舞蹈视频生成的模型,支持通过单张人物图片和音乐音频自动生成长时长舞蹈视频,适用于短视频制作、数字人内容创作、舞蹈演示与AI视频生成场景。

Wan-Dancer – 阿里通义开源的人像音乐驱动舞蹈视频生成模型

Wan-Dancer的核心优势

Wan-Dancer的主要功能

Wan-Dancer的技术原理

Wan-Dancer与主流模型对比

对比维度Wan-DancerKling AIViggle AIMuseDance
开发机构阿里通义快手Viggle学术团队
输入方式图片+音乐文本+图片图片+动作视频图片+音乐
舞蹈生成支持部分支持支持支持
身份一致性中高
音乐同步一般一般
最长视频分钟级数十秒短视频数秒级
开源情况开源闭源闭源开源
适用场景数字人舞蹈通用视频动作迁移学术研究

从定位来看,Wan-Dancer与MuseDance均属于音乐驱动舞蹈视频生成模型,但Wan-Dancer更强调长时视频生成和实际创作场景。Kling AI主要面向通用AI视频生成,支持更丰富的视频创意任务,但舞蹈动作与音乐同步并非核心方向。Viggle AI则侧重角色动作迁移和图片动画生成,适合人物动作复现。相比之下,Wan-Dancer结合音乐理解、角色一致性控制和分钟级视频生成能力,更适用于数字人舞蹈、虚拟偶像、音乐可视化及AI短视频创作等场景,而MuseDance更偏向学术研究和算法验证。

如何使用Wan-Dancer

  1. 准备素材:上传一张清晰人物全身照片以及音乐文件。建议图片分辨率不低于1024×1024,音乐长度控制在30秒至180秒之间,可获得更稳定输出效果。
  2. 设置舞蹈风格:输入舞蹈提示词,例如“K-pop Dance”“Street Dance”或“中国古典舞”。明确风格标签能够帮助模型匹配对应动作模式并提高生成准确性。
  3. 配置生成参数:设置视频分辨率720P、帧率30FPS以及生成时长。对于首次体验用户,可先测试15秒到30秒视频,再逐步增加长度优化结果。
  4. 启动视频生成:提交任务后模型会先分析音乐结构,再进行关键帧规划和视频扩散生成。生成时间与视频长度和服务器配置相关,长视频耗时更高。
  5. 后期优化输出:完成生成后可进一步使用视频剪辑软件调整字幕、转场和背景效果。对于商业短视频场景,可结合数字人口播和AI配音形成完整内容。

如何使用Wan-Dancer

  • 在线体验:访问魔搭社区的Wan-Dancer体验页,上传一张9:16比例的单人正面照片和10-30秒音乐文件,选择舞蹈风格后点击生成。
  • 本地部署:开发者可从GitHub获取Wan-Dancer项目代码,安装Python环境及依赖库后,通过ModelScope下载14B模型权重。完成配置后运行全局关键帧生成与局部时序细化脚本,即可在本地生成音乐驱动舞蹈视频。
  • DiffSynth-Studio:安装DiffSynth-Studio后加载WanVideoPipeline模型配置,设置参考人物图片、音乐文件和关键帧参数即可开始生成视频。

Wan-Dancer的局限性

  • 硬件资源需求:长时视频生成需要较高显存资源。超过一分钟的720P视频会显著增加显存占用和推理时间,原因在于扩散模型需要处理大量连续帧,目前官方主要推荐云端运行。
  • 复杂动作限制:极端高速街舞和体操动作场景仍可能出现局部肢体失真。原因在于动作跨度过大导致运动轨迹预测难度增加,官方后续版本计划持续优化运动控制模块。
  • 商业化信息有限:目前公开资料主要集中于技术论文和项目演示,对于API价格、并发限制和企业部署细节尚未完全公开。后续商业版本可能提供更多企业级能力。

Wan-Dancer相关资源

  • 项目官网:https://humanaigc.github.io/wan-dancer-project/
  • GitHub仓库:https://github.com/Wan-Video/Wan-Dancer
  • HuggingFace模型库:https://huggingface.co/Wan-AI/Wan-Dancer-14B
  • arXiv技术论文:https://arxiv.org/pdf/2607.09581

Wan-Dancer的典型应用场景

  • AI短视频创作:输入人物照片和30秒热门音乐,系统自动生成舞蹈短视频。创作者可直接输出社交媒体内容,提高视频生产效率并降低拍摄成本。
  • 虚拟偶像运营:输入虚拟角色立绘和歌曲音频,通过模型生成完整舞蹈演出内容。输出结果可用于演唱会宣传、粉丝互动和数字IP运营。
  • 音乐可视化制作:输入原创音乐作品,系统根据节奏生成对应舞蹈画面。输出视频能够增强音乐传播效果并丰富MV制作形式。
  • 舞蹈教学演示:输入教学音乐和标准人物形象,生成规范动作演示视频。学员能够通过视频观察动作节奏和身体姿态,提高学习效率。
  • 数字人营销:输入品牌代言数字人和推广音乐,生成营销短视频内容。输出结果可用于电商宣传、品牌活动和产品推广场景。

Wan-Dancer常见问题

Wan-Dancer怎么用?

Wan-Dancer需要上传人物图片和音乐文件进行生成,随后设置舞蹈风格和视频参数即可启动任务。

Wan-Dancer免费吗?

开源版本可以自行部署使用,但需要满足显卡和计算资源要求。部分在线体验平台可能提供免费试用额度,正式商业使用通常需要消耗云端算力资源,使用前应确认平台规则。

Wan-Dancer支持哪些舞蹈风格?

据官方项目展示,目前支持中国古典舞、K-pop、街舞、拉丁舞和踢踏舞等多种风格,同时支持通过提示词自定义舞蹈类型。

Wan-Dancer和Kling AI哪个好?

两者定位不同。Wan-Dancer专注音乐到舞蹈生成和长时动作连续性,而Kling AI偏向通用视频生成。如果目标是舞蹈短视频和数字偶像内容,Wan-Dancer的专业适配能力更突出。

Wan-Dancer支持API调用吗?

据官方项目资料和测试信息显示,目前提供API版本能力,最长可支持约3分钟音乐输入。

喜欢(0)

上一篇

如何提升Hello Kitty My Dream Store店铺排名

如何提升Hello Kitty My Dream Store店铺排名

下一篇

ABot-World Studio – 高德发布的AI世界生成与3D场景构建模型

ABot-World Studio – 高德发布的AI世界生成与3D场景构建模型
猜你喜欢