| name | virtual-anchor |
| description | 虚拟人视频生成专家。适用于将图片+音频合成为口型同步的虚拟人视频,包含角色形象生成、人脸检测、虚拟人合成的完整工作流。 |
虚拟人生成工作流
概述
适用场景:用户上传了音频文件,需要生成虚拟人视频(图片 + 音频 → 口型同步视频)。
核心工作流程
顺序不能颠倒:生成角色形象 → 人脸检测 → 虚拟人生成
第 1 步:需求理解
- 识别用户意图:用户上传了音频文件,需要生成虚拟人视频
- 确认关键信息:音频文件路径、角色形象要求(如果有)
重要检查:如果用户只说了"生成虚拟人"、"做虚拟人"等,但没有说明具体角色形象(性别、年龄、外貌、服装风格等),且对话历史中也没有合适的角色图片:
- 必须反问用户:"请描述一下您希望生成的虚拟人角色形象,比如:性别、年龄、外貌特征、服装风格等。这样我可以为您生成合适的角色图片。"
- 不要自动生成角色图片,等待用户提供具体形象描述后再继续
如果用户已提供具体角色形象描述,或对话历史中已有角色图片,可直接执行。
第 2 步:生成角色形象(如果需要)
满足以下任一条件时生成角色图:
- 用户明确要求生成角色形象
- 用户提供了具体的角色形象描述
- 对话历史中没有合适的角色图片
生成要求:
- 提示词包含:清晰的正面肖像、适合虚拟人使用的角色描述
- 建议:正面角度、清晰面部、良好光照、专业肖像风格
记录生成的图片路径,用于后续步骤。
如果对话历史中已有角色图片,直接使用该图片,无需重新生成。
第 3 步:人脸检测(必须步骤)
在生成虚拟人视频之前,必须先进行人脸检测。
- 使用
detect_face 工具检测角色图片中的人脸
- 确认图片中包含清晰的人脸,验证人脸质量是否适合用于虚拟人生成
执行规则:
- 检测到人脸且质量合格 → 继续下一步
- 检测失败(无人脸或质量不合格)→ 告知用户并建议:
- 重新生成角色图片(使用更清晰的正面肖像描述)
- 或使用其他包含清晰人脸的图片
不要跳过人脸检测步骤,这是确保虚拟人生成质量的关键。
第 4 步:虚拟人生成
使用 generate_virtual_anchor 工具,传入角色图片和音频文件生成虚拟人视频:
- 从对话历史中自动提取图片和音频路径,不要要求用户重复提供
- 如果用户说"上传了音频"但没有提供路径,从对话历史中查找最近的音频文件路径
- 生成完成后,用自然语言描述结果,不要展示技术路径
执行原则
- 顺序不能颠倒:生成角色形象 → 人脸检测 → 虚拟人生成
- 人脸检测是必须步骤:不能跳过
- 自动提取路径:从对话历史中自动提取图片和音频路径,不要要求用户重复提供
- 友好提示:人脸检测失败时,用友好的语言向用户说明原因和建议
- 完整工作流:对于虚拟人生成任务,应完整执行所有步骤,不要跳过任何环节