VideoAgents · AI Agent 视频生产团队

视频数码体:把小说变成分集短剧的 AI 智能体团队

83 个专业 Agent、13 个制作部门,从小说改编、资产设计、分镜运镜到成片发布全流程自动化,每一步都有人工确认闸门兜底。开源、本地运行,数据不上传。

Sound Familiar?

做 AI 中长剧,这些坑你可能已经踩过

传统视频团队从「一分钟 AI 短剧」转向「十分钟级 AI 中长剧」时,普遍会撞上同一批问题。

How VideoAgents Solves It

视频数码体是怎么应对这些问题的

以下每一条解法均可在产品代码仓库中找到对应的 Agent 职责定义,没有代码依据的能力一律不写。

01

道具 / 服装跨镜跳变 → 全片资产库 + 比例锚图 + 换装矩阵

传统实拍剧组有道具库、服装库来保证"这件东西全程长一个样";视频数码体把这套逻辑做成了文件化的资产系统:

  • 道具 Agent为每件剧情道具建卡,记录外形材质、易主链,并强制生成"比例锚图"(道具与参照物同框,标注相对尺度),供视频生成时锚定,避免道具凭空变大变小、变色变材质。
  • 服装 Agent为每个主要角色按「场合 × 时期」建服装矩阵,精确标注每个换装点发生在哪一个剧情事件之后,避免出现"该换的时候没换、不该换的时候换了"。
  • 服装概念 Agent为每套服装出一张与角色定妆图同源的参考图,让"这个人穿这套衣服"有图可依,而不是全靠文字描述硬猜。
02

多人镜头调度、空间关系复杂 → 分镜空间锚点系统

横屏中长剧最考验的长镜头调度、多人同框、景别切换,视频数码体用结构化的分镜与空间标注来处理:

  • 导演分镜链路(走位、运镜、构图、连续性核查 Agent)在生成前把每一镜的机位、动线、人物站位都设计清楚。
  • Prompt Agent会为每个生成组配一张"人物动线俯视图"和一张"场景九宫格多角度图",并在生成指令里逐字标注每个角色在图上对应的字母标记,让模型明确"谁站在哪、面朝哪、走到哪",而不是靠文字含糊描述空间关系。
  • 连续性规划 Agent在镜头设计冻结前,专门检查相邻镜头/相邻生成组交界处的轴线、光线方向是否连续,把穿帮拦在生成之前。
03

戏剧语言难翻译成 AI 听得懂的指令 → Prompt 工程标准化

视频数码体设了专门的 Prompt Agent,把导演的分镜设计"翻译"成生成模型能精确执行的指令:

  • 每一镜按"运镜方式 + 主体动作与表情 + 空间位置 + 音频信息"四要素结构化写入,一镜只用一种运镜手法,避免相互矛盾的指令。
  • 动作描述要求具体到肢体部位并量化幅度与速度(比如"缓慢抬手"而不是笼统的"抬手"),情绪一律转成看得见的身体细节(悲伤→低头、肩膀微颤;紧张→呼吸急促、手指敲击),而不是留一句抽象的情绪词让模型自由发挥。
04

表演细节(如细微表情)难靠指令精确控制 → 表演证据层

针对台词场景与情绪高点场次,Prompt Agent 会把"这场戏该怎么演"拆解成可执行的表演节拍:说话前的状态、说到关键词时脸部哪个区域怎么动、呼吸停顿在哪、说完后停在什么状态——把导演的表演意图变成模型看得懂的具体证据,而不是一句"情绪要到位"。

05

人一多容易乱、角色形象跑偏 → 角色一致性校正 + 防重复约束

  • 角色一致性 Agent对每一张新生成的关键帧做人脸比对,相似度低于 0.85 自动重新生成(最多 3 次),不达标不放行。
  • Prompt 里会显式声明"画面里有且只有 N 个人、每个人都要匹配参考图、不允许多出或重复的人物",从源头上抑制"无中生多人"的问题。
06

不确定性是个无底洞、返工成本不可控 → 分阶段人工确认闸门

视频数码体在世界观、角色资产、美术风格、剧本、每集分镜、每集生成画面、成片、发布 8 个关键节点都设了人工确认闸门(签字后才能进入下一阶段)。这意味着问题能在早期(比如角色形象、风格没定对)就被拦下签字环节重来,而不是等到成片阶段才发现要推倒重做。

07

人脸版权风险、"平均脸"审美疲劳 → 原创角色设计,不基于真人换脸

视频数码体的角色形象是角色概念 Agent根据角色设定文字(性别、发色、瞳色、体型、标志物等)与美术风格生成的原创人设图,不是拿真人照片做换脸或融脸处理——从源头上避免了肖像权风险,角色长相由设定驱动而非"抓一张网图糊上去"。

08

审查环境严格,细节把关 → 内容安全终审 + 版权终审

  • 内容安全 Agent在每集终审阶段逐镜扫描暴力、裸露、危险行为等各平台红线,并给出分级建议,封面、字幕、片头片尾一并审查。
  • 版权 Agent核验每一项素材(BGM、字体、参考图等)的授权来源、许可类型与授权范围,拿不出授权记录的素材不允许上片。
09

AI 配音目前只适合"修补" → 默认画面原生对白,后期配音仅作补录

视频数码体默认让视频生成模型直接原生合成画面里的对白语音与口型(不是拿 TTS 音轨去"配"上去);只有在项目设置里显式开启"后期配音"时,才会走单独的补录流程去修补个别镜头的台词音轨——这与传统团队"AI 配音暂时只适合修补"的经验判断是一致的,视频数码体没有夸大 AI 配音能整部剧全包办。

10

创作记录难留痕 → 全程文件化产物 + 项目内版本管理

每一步产出(设定卡、参考图、分镜、生成参数)都落成文件,项目本身有内置的版本管理(基于 Git 技术),每次生成的模型/渠道/参考图都会记入元数据,方便追溯"这一版是怎么来的"。

Core Features

一套系统,覆盖从小说到成片的全流程

剧情与世界观改编

把长篇小说的情节、世界观、时间线拆解成结构化数据,作为后续所有创作环节的事实依据。

角色与资产设计

角色外观、性格、关系、声音、服装、道具、场景、生物——每一类都建卡立库,并生成对应的参考图/声音样本,作为全片生成时的"唯一形象锚点"。

导演分镜与运镜

自动完成分镜脚本、机位、构图、走位、连续性核查,把导演意图转化为结构化的镜头设计文件。

视觉与音频生成

对接图像、视频、音乐、TTS 等多种可配置的生成服务,按分镜设计和资产锚点批量生成画面与声音,并做一致性校正。

剪辑与合成

把生成的镜头素材按分镜顺序合成、加字幕花字、配乐混音,产出可发布的成片。

质量审核(8 个 QA 并行)

逻辑、角色一致性、时间线、世界观一致性、视觉质量、音频质量、内容安全、版权 8 个维度并行审核,8 份报告全绿才能签发发布。

人工确认闸门

世界圣经、角色资产、美术风格、剧本、每集分镜、每集视觉生成、成片、发布——8 个节点由真人签字确认,创作方向始终在人的掌控之中。

多引擎、多模型可配置

执行引擎支持 Claude CLI、Codex CLI 和 OpenAI 兼容的 DeepAgents;图像、视频、音乐、TTS、对象存储等生成服务均可在控制台单独配置,不锁定在某一个模型或渠道上,模型更新了也不用推倒重来。

本地运行,数据不上传

项目素材(小说原文、配置、生成媒体)默认保存在本地 data/projects/,不会提交到 Git;控制台默认只监听本机地址。

开源可自托管

以 Apache License 2.0 协议开源,允许使用、修改、分发和商业使用。

Get Started

三步开始你的第一部 AI 改编短剧

  1. 下载并安装客户端(见下方「下载」区);安装包不含 Python 运行时,首次启动如本机没有可用环境会自动下载配置,无需手动安装 Python。
  2. 配置执行引擎与生成服务:首次打开时选择或创建项目,配置至少一种执行引擎(Claude CLI / Codex CLI / DeepAgents 三选一)以及实际要用到的图像/视频/音乐/TTS 等生成服务凭据。
  3. 导入小说,跟随人工确认闸门推进:新建项目并导入小说文本后,系统会依次产出世界观、角色资产、美术风格、剧本、分镜——每个关键节点都会停下来等你签字确认,确认无误再进入下一步,直到成片与发布。

面向开发者的补充路径(源码运行,来自 README 快速开始):

git clone https://github.com/AgenticsWorld/VideoAgents.git
cd VideoAgents
python3 -m venv .venv && source .venv/bin/activate
python -m pip install --upgrade pip && python -m pip install -e .
python apps/web/server.py

浏览器打开 http://127.0.0.1:8630 即可使用。

Download

下载视频数码体客户端

平台说明下载
macOS
下载后解压安装;安装包不含 Python 运行时,首次启动按需自动下载配置 下载 macOS 版
Windows
下载后解压安装;同上 下载 Windows 版

运行前还需要准备什么

FAQ

常见问题

使用视频数码体需要自己装 Python 环境吗?
不需要。发布的桌面客户端安装包不包含 Python,首次启动时如果本机没有可用环境,客户端会自动下载配置;只有做桌面开发或从源码打包时才需要自行准备 Python/Node 环境。
视频数码体支持哪些 AI 模型/生成引擎?
Agent 执行引擎支持 Claude CLI、Codex CLI 和 OpenAI 兼容的 DeepAgents,三选一或按需切换;图像、视频、音乐、TTS 与对象存储等生成服务均可在控制台单独配置对接的渠道,不绑定单一模型厂商。
我的小说原文和生成的视频素材会被上传到云端吗?
默认不会。项目素材(小说原文、项目配置、生成的图片/音视频)默认保存在本地 data/projects/ 目录,不会提交到 Git;本地控制台默认只监听 127.0.0.1
视频数码体开源吗?可以商用吗?
是。项目以 Apache License 2.0 协议开源,允许使用、修改、分发和商业使用;再分发时需要保留许可证与版权声明。
生成的画面角色形象跑偏、道具变了样怎么办?
系统有自动校正机制——比如角色关键帧会自动做人脸相似度比对,低于阈值会自动重新生成(最多 3 次);更重要的是,资产库(角色三视图、服装矩阵、道具比例锚图)会作为每次生成的参照锚点,加上分阶段人工确认闸门,大部分形象问题能在早期签字环节被拦下,而不必等到成片才发现。