Guide · 使用教程
Hedra 教程:从角色图片和声音到可发布的视频工作流
用获得授权的角色图和干净音频,在 Hedra 中拆镜头生成说话角色,并完成多比例导出、成本与商用检查。
Hedra 最适合的不是随便上传一张照片“试试看”,而是把一套获得授权的角色设定、清晰音频和短镜头脚本变成可复用的视频流程。这篇教程会制作一条 30 秒品牌吉祥物介绍视频,并同时导出横版、方形和竖版素材。
这篇教程会完成什么
最终会得到:
- 一份冻结的 30 秒脚本
- 一张具有明确使用权的角色主参考图
- 三张辅助角度或表情参考
- 一段经过清理的角色声音
- 三到五个短角色镜头
- 一个不依赖生成模型写字的品牌片尾
- 横版、方形和竖版三个版本
- 一份 credits、素材授权和人工检查记录
关键目标不是一次生成完整 30 秒,而是让每个镜头都能单独检查、替换和重新生成。
开始前需要准备
1. 确认角色权利
角色可以是:
- 团队原创的插画或 3D 人物
- 拥有完整授权的品牌吉祥物
- 由本人创建并同意使用的真人数字分身
- 已获得明确商业许可的角色资产
不要使用:
- 影视、游戏或漫画中的已知角色
- 从社交媒体下载的陌生人照片
- 未经许可的员工、客户或名人肖像
- 只有“可以看”但没有衍生视频权利的图库素材
- 不能证明来源的 AI 生成角色
Hedra 的 Acceptable Use Policy 对输入他人的照片、声音、视频和个人信息限制严格。即使某张照片公开可见,也不代表可以上传平台制作角色视频。
2. 准备角色设定表
最少准备四张图:
- 正面主参考,光线均匀,脸部或角色主要特征清楚。
- 三分之二角度,检查鼻子、耳朵、头发和配饰。
- 侧面或动作参考,说明身体比例。
- 表情参考,展示开心、平静或惊讶等可用范围。
固定以下信息:
角色名:Momo
角色类型:原创圆形毛绒品牌吉祥物
固定颜色:珊瑚橙主体、深棕眼睛
固定特征:头顶三根短毛、无服装、圆形手脚
禁止变化:不能增加牙齿、帽子、文字、Logo 或人类手指
表演风格:友好、轻快,不夸张尖叫
如果是真人 Digital Twin,还要保存本人同意书、允许用途、使用期限和撤回方式。
3. 写短镜头脚本
不要直接把 30 秒脚本当成一个长镜头。先拆成:
- 镜头 1:3 秒,角色出现并打招呼
- 镜头 2:8 秒,说明用户问题
- 镜头 3:8 秒,解释解决办法
- 镜头 4:7 秒,给出一个实际例子
- 镜头 5:4 秒,结束动作并留片尾空间
每个镜头只表达一个意思。句子越长、动作越多,嘴型和角色稳定性越难控制。
示例:
镜头 1
台词:你好,我是 Momo。今天用半分钟告诉你,怎么让品牌短视频更稳定。
情绪:友好、轻快
动作:轻微点头,右手短暂挥动
镜头:固定中景
禁止:不要改变颜色,不要新增文字,不要移动背景家具
第一步:创建项目并记录预算
打开 Hedra Creative Studio,新建一个单独项目。用清楚的命名分区:
01_APPROVED_CHARACTER
02_SCRIPT_AND_AUDIO
03_CHARACTER_TESTS
04_APPROVED_SHOTS
05_CHANNEL_EXPORTS
06_LICENSE_AND_COST_LOG
生成前查看账号当前计划、credits 余额和所选模型成本。
截至 2026 年 8 月 25 日,Hedra 月付计划为:
- Basic:15 美元,1,500 credits
- Creator:30 美元,5,400 credits
- Professional:75 美元,14,400 credits
- Teams:75 美元,14,400 credits
- Enterprise:定制
免费输出可能带水印且非商用。Character-3 官方模型页当前显示每秒 8 credits,但其他模型费率不同。不要用一个模型的价格估算所有操作。
预算表建议记录:
| 项目 | 计划值 | 实际值 |
|---|---|---|
| 总脚本时长 | 30 秒 | 完成后填写 |
| 预计生成次数 | 每镜头 3 次 | 完成后填写 |
| 预计有效镜头数 | 5 | 完成后填写 |
| Character-3 单秒 credits | 账号实时值 | 完成后填写 |
| 图片与音频额外消耗 | 账号实时值 | 完成后填写 |
| 后期人工时间 | 2 小时 | 完成后填写 |
第二步:准备和导入角色图
选择干净、清晰的主参考图:
- 主体完整且没有被裁掉
- 光线均匀
- 眼睛、嘴和轮廓清楚
- 背景简单
- 没有假文字、Logo 或复杂小物件
- 画面比例接近最终镜头
如果使用 AI 生成角色,先在图像阶段冻结最终版本。不要在角色视频生成时继续改变发型、服装、颜色和年龄。
对吉祥物,可以先做一个纯背景角色主图,再在后期合成品牌环境。这比让视频模型同时维持角色和复杂背景更稳定。
第三步:录制或生成干净音频
口型质量很大程度由音频决定。
录音要求:
- 安静房间,减少回声
- 麦克风距离和音量保持稳定
- 不使用过强背景音乐
- 删除爆音、长空白和杂音
- 每个镜头单独导出音频
- 文件名包含镜头号和版本
示例:
MOMO_SHOT01_GREETING_v1.wav
MOMO_SHOT02_PROBLEM_v2.wav
MOMO_SHOT03_SOLUTION_v1.wav
如果使用声音克隆,只能克隆本人声音或获得明确许可的声音。不要用“听起来像某位名人”的提示规避授权。
中文台词要特别检查数字、英文品牌词和多音字。先让真人听一遍,再生成视频。
第四步:先做 5 秒角色测试
不要马上生成完整镜头。先选择 Character-3 或账号中适合的音频驱动模型,用 5 秒音频测试:
- 静态中景
- 中性表情
- 简单背景
- 低风险动作
- 一个清楚句子
检查:
- 嘴型是否跟上音节。
- 闭口音时嘴是否真的闭合。
- 牙齿、舌头和下巴是否异常。
- 眼睛是否频繁跳动或漂移。
- 角色颜色和配饰是否改变。
- 音频开始和结束是否被截断。
- 导出是否有水印。
- 当前计划是否允许最终用途。
只有这个测试通过,才继续完整镜头。
第五步:建立角色提示词模板
每个镜头都重复固定身份,不能只在第一个镜头写角色描述。
模板:
使用批准的 Momo 角色参考。
保持珊瑚橙毛绒材质、圆形身体、深棕眼睛和头顶三根短毛。
角色以友好、轻快的方式说话,动作克制。
固定中景,柔和室内光,简单暖灰背景。
只根据上传音频驱动嘴型和表情。
不要增加文字、Logo、衣服、牙齿、人类手指或新的配饰。
不要改变角色颜色、身体比例或年龄。
每个镜头只增加动作和情绪变量。例如“轻微点头”或“最后一秒挥手”,不要一次要求走路、转身、拿产品、跳跃和改变镜头。
第六步:逐镜头生成
每个镜头先生成两到三个版本。不要无限重试同一个提示。
建立评分表:
| 检查项 | 通过标准 | 处理方式 |
|---|---|---|
| 身份 | 颜色、眼睛、毛发、比例一致 | 不通过则回到主参考 |
| 口型 | 重点音节匹配,没有持续张嘴 | 不通过则清理音频 |
| 表情 | 符合台词,不夸张 | 缩小情绪描述 |
| 动作 | 不遮挡脸和嘴 | 减少手势 |
| 背景 | 没有漂移或假字 | 简化背景 |
| 时长 | 首尾没有被裁掉 | 音频前后留短静音 |
| 商用 | 计划和素材均允许 | 保存授权记录 |
如果一个镜头连续三次出现同类错误,不要继续烧 credits。改变一个变量:音频、参考图、镜头长度或动作,而不是同时重写所有内容。
第七步:控制角色一致性
跨镜头稳定需要人为约束:
- 所有镜头使用同一张批准主参考
- 不在不同镜头切换不同角色生成模型
- 固定背景颜色、光线和镜头距离
- 固定角色名称与特征描述
- 每次只改变一项动作或情绪
- 保存批准镜头的首尾帧做视觉对照
- 不让模型生成准确 Logo、包装文字或字幕
当角色出现明显漂移时,回到角色主图。不要把已经漂移的视频帧继续作为下一镜头参考,否则错误会逐步累积。
第八步:制作横版、方形和竖版
优先生成一个有安全留白的主版本,再适配:
- 16:9:网站、YouTube 和演示
- 1:1:社交帖子
- 9:16:短视频和故事
不要简单裁切主体的脸或手。对竖版重新安排角色位置,同时保留字幕区和平台 UI 安全区。
字幕、价格、Logo 和行动按钮应在剪辑或设计软件中加入。生成模型里的文字不够可靠,也不方便品牌和法律审查。
第九步:加入背景和辅助镜头
Hedra 可以生成或调用其他视频模型,但不要让一个角色镜头同时承担所有信息。把视频拆成:
- 角色说话镜头
- 产品或场景辅助镜头
- 图形和字幕
- 片尾品牌信息
如果需要复杂摄像机运动和电影化效果,可以使用 Higgsfield AI 生成辅助画面;如果需要企业模板和多语言版本,可以把脚本与角色策略改造成 HeyGen 流程。
组合工具时记录每个镜头使用的平台和模型,避免最后无法确认授权来源。
第十步:后期剪辑与音频
在专业剪辑软件中完成:
- 删除不自然的起止帧
- 统一镜头颜色和对比度
- 调整音量和背景音乐
- 加入人工校对的字幕
- 加入真实 Logo、字体和法律文字
- 做横版、方形和竖版排版
- 检查压缩后嘴型是否仍清楚
- 导出平台要求的分辨率和码率
不要用 AI 生成的包装文字、价格或免责声明替代真实排版文件。
第十一步:商用、隐私与安全检查
发布前确认:
- 角色、真人肖像、声音、音乐和字体均有授权。
- Hedra 当前计划允许该用途。
- 免费带水印输出没有混入正式交付。
- 所用上游模型与生成日期已记录。
- 没有上传未经许可的他人个人信息。
- 真人数字分身有明确同意与撤回流程。
- 内容没有冒充新闻、医疗专家或真实人物。
- 对容易误认的画面加入 AI 合成标识。
- 客户机密素材符合数据处理合同。
- 删除不需要继续保留的高风险源文件。
- 人工检查字幕、产品信息、价格和法规文字。
- 高风险项目经过品牌、法务或合规审批。
Hedra 条款表示用户在平台与用户之间保有输入和输出权利,但仍需遵守素材权利、上游模型条款和平台许可。平台付费商用不等于对所有生成内容提供侵权担保。
常见错误
角色每个镜头长得不一样
固定主参考、模型、背景、镜头距离和身份提示。不要使用上一段已经漂移的输出继续生成。
嘴型不匹配
清理回声和背景音乐,拆短句,保留自然停顿。先测试 5 秒,不要直接重做整个长镜头。
credits 消耗过快
限制每镜头版本数,先低成本测试,再生成高分辨率。记录失败原因,连续出现同类错误时停止重试。
角色手势遮挡脸
删除复杂动作,只保留点头、轻微挥手等单一动作。口播镜头不需要电影级调度。
包装和 Logo 变形
生成阶段不处理准确文字和 Logo。使用真实产品图或在后期软件中叠加品牌资产。
免费测试片不能交付
免费版可能带水印且非商用。正式项目开始前先确认付费计划、素材授权和导出权限。
什么时候该换别的工具
- 需要电影镜头、产品广告和视觉特效:Higgsfield AI
- 需要标准企业数字人和 175 种语言本地化:HeyGen
- 需要大规模课程、培训模板和治理:Synthesia
- 需要实时视频 Agent 嵌入产品:Tavus
- 需要文字自动生成长视频和配音:Fliki
- 需要全部本地处理:选择可自托管的开源角色和 lip-sync 工作流
最终交付清单
导出前逐项确认:
- 五个镜头使用同一个批准角色
- 嘴型、眼神、牙齿和下巴没有明显异常
- 首尾帧没有突然跳变
- 横版、方形和竖版都保留安全区
- 字幕、Logo、价格和法律文字来自真实排版
- 音量和音乐授权符合平台要求
- 免费水印素材没有混入正式版本
- 角色、声音和模型记录完整
- 真人或声音克隆有书面同意
- credits 与人工成本已经登记
- AI 合成标识符合发布场景
- 项目文件和授权记录可供以后审计
只要先冻结角色和声音、把长脚本拆成短镜头、限制每次只改变一个变量,并把授权与成本记录纳入流程,Hedra 就能从有趣的角色演示变成可重复交付的内容工具。
常见问题
- Hedra 做角色视频需要准备什么?
- 至少准备一张获得授权的清晰角色主图、一段拆成短镜头的脚本、干净音频、角色设定表、输出尺寸和商用授权记录。
- 为什么不建议一次生成完整 30 秒?
- 长镜头更容易出现身份、嘴型、手势和背景漂移。拆成三到五个短镜头更容易检查、替换和控制 credits。
- Hedra Character-3 怎么计算 credits?
- 官方模型页当前标示为按生成视频秒数消耗,每秒 8 credits;其他模型、分辨率和操作价格不同,应以账号实时值为准。
- 可以用别人的照片或声音做角色吗?
- 不能因为素材公开就直接使用。需要明确书面许可,并确认 Hedra AUP、隐私要求和具体商业用途都允许。
- 如何让多个镜头中的角色保持一致?
- 始终使用同一主参考、同一模型、固定身份描述、背景和镜头距离;每次只改变一个动作或情绪变量。
- Hedra 生成的视频还需要剪辑吗?
- 需要。字幕、Logo、价格、法律文字、音量、音乐、转场和多比例适配都应在专业剪辑或设计软件中完成。