---
name: 视频二次原创
description: 根据提供的原创视频进行二次创作
metadata:
    tools: [vision, hearing, generateVideo, videoEditor, videoInfo, videoDownloader]
---

## 0. 准入检查
* **动作**：检测对话中是否提供目标视频。
  * **有 URL**：调用 `videoDownloader` 下载视频。
  * **无视频/URL**：立即中断并提示：“请上传需要二次创作的原片/视频链接，以便我进行深度解析。”
## 1. 视频特征提取 (`videoInfo`)
* **任务**：获取原视频基础参数，对齐生成规格。
* **输出**：画面比例（将分辨率转为标准比例如 9:16 或 16:9）、帧率 (FPS)、总时长。
## 2. 反推视频提示词 (`vision`)
### 首次视觉分析
调用 `vision`，使用以下分析提示词。
图片：
> 请详细分析这张图片，以便将其重建为 AI 图片生成提示词。只描述画面中能够观察到的内容。依次分析：主体及其外观、动作和表情、环境、构图、景别、视角、镜头或焦段观感、光线方向和光质、色彩、材质、景深、视觉风格、后期质感、画面比例，以及容易遗漏的细节。区分确定信息与不确定推测。最后给出影响画面相似度最大的视觉要素。
视频：
> 请完整分析这个视频，以便将其重建为 AI 视频生成提示词。按时间顺序分析：主体、环境、动作过程、镜头运动、景别和视角变化、构图、光线、色彩、材质、视觉风格、节奏、速度、物理运动、前后帧连续性、转场和结尾状态。请给出分镜时间线，并区分主体运动与摄影机运动。只描述能够观察到的内容，不猜测不可见信息。最后列出影响视频相似度最大的视觉要素。
### 针对性补充分析
如果首次结果缺少关键细节，再调用一次 `vision`。不要无目的重复分析。
图片补充提示词：
> 请重新检查该图片，重点补充容易影响生成相似度的细节：主体数量和空间关系、手部和姿态、服装或物体材质、背景层次、光源位置、阴影、焦点位置、景深、镜头畸变、颗粒感、调色和画面比例。指出此前描述中可能不准确或存在歧义的部分。
视频补充提示词：
> 请重新检查该视频，重点核对每个镜头的持续时间、主体动作起止状态、摄影机运动方向和速度、焦点变化、遮挡关系、转场、运动模糊、物理交互及跨帧一致性。输出适合写入视频生成提示词的精确动作和运镜描述。
### 组织提示词
图片提示词按照以下顺序组织：
`主体 + 外观细节 + 动作/表情 + 环境 + 构图/景别 + 镜头视角 + 光线 + 色彩 + 材质 + 风格 + 画质`
视频提示词按照以下顺序组织：
`初始画面 + 主体动作时间线 + 环境变化 + 摄影机运动 + 光线与色彩 + 运动节奏 + 物理表现 + 连续性约束 + 结束画面`
不要堆砌相互冲突的风格词。优先保留对结果影响最大的具体描述。
### 输出格式
#### 视觉分析
简明概括主体、场景、构图、光影、风格。视频额外概括动作和运镜。
#### 中文提示词
输出一段可直接使用的完整提示词。
#### 负面提示词
仅包含与目标画面相关的排除项，例如：
- 错误主体数量
- 人体或手部畸形
- 构图错误
- 不需要的镜头运动
- 闪烁、跳帧、形变
- 风格或画质偏差
不要无意义地堆积通用负面词。
#### 建议参数
仅在能够合理判断或用户要求时提供：
- 画面比例
- 时长和帧率
- 镜头运动强度
- 风格化强度
无法从视觉内容判断的参数标记为“建议值”，不要冒充原始参数。
#### 不确定项
列出可能存在多种解释、无法从素材确认的内容。
#### 视频分镜规则
视频包含多个镜头时，额外输出：
| 时间段 | 画面内容 | 主体动作 | 摄影机运动 | 光线/转场 |
|---|---|---|---|---|
然后提供：
1. 一条完整视频提示词
2. 每个镜头的独立提示词
3. 跨镜头一致性要求
如果更适合单镜头生成，应明确建议分镜生成后再剪辑，不要把复杂多镜头硬塞入一个提示词。
### 质量检查
输出前确认：
- 主体数量、方向和动作没有遗漏
- 摄影机运动与主体运动已明确区分
- 没有加入素材中不存在的关键物体
- 提示词内部不存在风格、光线或运镜冲突
- 视频提示词包含起始状态、动作过程和结束状态
- 提示词可直接用于生成，而不只是分析报告
## 3. 音频解构与文案处理 (`videoEditor` & `hearing`)
* **任务**：提取音频并进行分类重构。
  1. **提取转录**：调用 `videoEditor` 提取音频，调用 `hearing` 获取全文。
  2. **智能分流**：
     * **若为音乐**：记录原声文件路径，保留留待第 5 步使用。
     * **若为人声（口播/对白）**：进行“去重式洗稿改写”。保持核心语义，改变语序、句式或进行口语化重塑，确保字面重复率 < 30%。
## 4. 视频生成与长视频续作 (`generateVideo`)
* **任务**：基于分镜脚本与目标时长，采用 **“首段生成 + 尾帧续作”** 机制生成完整视频。
* **生成策略**：
  * **阶段一：首段生成（调用 `generateVideo`）**
    * **配置参数**：
      - `model`：固定为 `minimax-h3`
      - `ratio`：对齐步骤1提取的画面比例
      - `duration`：根据分镜需求设定时长（范围4-15秒）
      - `referenceImages`：若基于参考图生成，传入对应图片路径数组；无参考图则传入空数组
      - `referenceAudios`：若需匹配音频口型，传入对应音频路径数组；无则传入空数组
      - `savePath`：指定首段视频本地保存路径（如 `part1_generate.mp4`）
    * **提示词 `prompt`**：使用步骤 2 的第一个分镜视觉提示词，明确起始画面与动作过程。
    * **输出**：获取第一段生成的视频本地路径，同时提取该视频的尾帧图片保存，作为续作首帧参考。
  * **阶段二：续作延长（若目标总时长超过首段生成时长，循环调用 `generateVideo`）**
    * **续作机制**：按需多次调用，每次生成4-15秒新片段；以上一段视频的**尾帧图片作为首帧参考**传入，保证画面无缝衔接。
    * **配置参数**：
      - `model`：固定为 `minimax-h3`
      - `ratio`：与首段保持完全一致
      - `duration`：设定本次扩展时长（4-15秒）
      - `referenceImages`：传入上一段视频的尾帧图片路径，作为首帧参考
      - `referenceAudios`：若需延续音频则传入对应音频，否则空数组
      - `savePath`：指定本次续作视频的保存路径（如 `part2_extended.mp4`）
    * **提示词 `prompt`**：使用步骤 2 中下一个分镜的提示词，**只需描述接下来发生的新动作和新画面**，并注明“以上一帧画面为起始，动作自然衔接”。
    * **输出**：获取本次续作生成的视频路径，提取其尾帧，作为下一段续作的输入参考。
## 5. 音视频重构 (`videoEditor`)
* **任务**：画面与声音的最终合成。
* **执行逻辑**：
  * **前提**：若第 3 步判定原音频为 **音乐/BGM**。
  * **处理**：调用 `videoEditor` 清除生成视频的底噪，将步骤 3 提取的原声音乐文件无损合并到最终生成的视频中。并做时长对齐处理（如视频较长则循环或截断，音乐较长则淡出处理）。