CapCut Video Studio 使用指南:从一个想法到完整视频
从入口、单镜头参数、Agent、Video Brief、Storyboard 与六类画布卡片,到坏镜头修复、Edit More 精剪和导出,按真实操作顺序讲清每一步。
- CapCut Video Studio 是画布式 AI 视频工作区:先组织想法和素材,再用 Agent、Brief 与 Storyboard 形成结构,之后生成镜头、精剪和导出。
- 第一次不要从十分钟长片开始;先做 20–40 秒、3–5 个镜头的短片,先验证关键镜头,再批量生成。
- 单镜头的 5–15 秒参数与完整视频的 30 秒–10 分钟是两层控制;先用短镜头验证主体、动作和运镜,再组装多场景成片。
- 六类画布卡片都是可继续操作的节点;参考素材必须写清各自负责人物、构图、动作、运镜、声音还是风格。
- 长视频不要一次生成到底;坏镜头按人物、媒体、动作/模型、旁白/音乐分别局部修复,再预览全片。
- 画布负责组织与生成,Edit More 后的多轨编辑负责节奏、声音、字幕和最终交付;生成结果不等于成片。
先看懂:CapCut Video Studio 到底是什么
这是一份实操指南,不是产品趋势分析。你读完后应该能做三件事:找到 Video Studio 的入口;用 Agent、Brief、Storyboard 和生成模型做出第一条多镜头视频;知道什么时候必须进入 CapCut 多轨编辑器继续精修。
CapCut Video Studio 是 CapCut Web 中一套以画布为中心的 AI 视频生产工作区。这里的 “timeline-free” 应理解为:开始创作时不必先面对传统时间线。你可以先在无限画布上放置文字、图片、视频和链接,让 Agent 帮你形成 Video Brief 和 Storyboard,再按镜头生成内容。需要精确控制节奏、转场、声音和包装时,仍然可以点击 Edit More 进入多轨编辑器。
它把原本散落在多个工具里的工作接到一起:构思 → 结构 → 分镜 → 生成 → 修改 → 精剪 → 导出。最值得记住的不是“一键”,而是每一步都留有可回退、可替换和可继续编辑的空间。
- 01定目标用途、观众、时长、比例
- 02放素材图片、视频、链接、角色参考
- 03做 Brief让 Agent 锁定方向与约束
- 04审分镜逐镜检查动作、信息与连续性
- 05生镜头先关键镜头,再批量生成
- 06精剪Edit More 进入多轨编辑
- 07验收导出画面、声音、字幕、规格
下面这段产品概览最适合先看一遍。它展示的不是某个单独模型,而是画布、Agent、生成和编辑如何连成一个项目。
先建立正确预期:Video Studio 能显著降低组织素材和搭建初稿的成本,但不会自动替你完成审美判断、事实核验和最终剪辑。
从哪里进入:Web 与 PC 两条路径
Web 入口
打开 CapCut Video Studio 或 CapCut Agent,登录后从 AI Creator / Video Studio 入口进入画布。不同账号看到的首页名称、按钮位置和可用模型可能不同,因此以你账号的实际界面为准。


PC 入口
在 CapCut PC 首页进入 AI 创作区,再打开 Video Studio。Web 和 PC 都能完成从提示词、参考素材、生成到调整和导出的主流程;PC 入口会把 Style、Voice、Avatar、Duration、Aspect Ratio 与 Edit More 桌面编辑器放得更集中。具体按钮仍以当前账号界面为准。


如果页面没有出现相同入口,先检查三件事:账号所在地区、客户端版本、当前订阅与灰度资格。不要因为找不到按钮就认定操作错误;CapCut 的功能会按地区、设备、语言、账号和时间变化。
最短上手路径:第一次先完整跑通
第一次使用不要同时挑战长片、复杂角色和十几种视觉风格。先做一条 20–40 秒、3–5 个镜头、一个主角、一个核心动作 的短视频,把全流程跑通。
第一步:把目标说清楚
在输入框里先写清五项:
- 成片用途:广告、剧情短片、知识解释、社交媒体还是产品演示。
- 目标观众:谁会看,观众已经知道什么。
- 核心信息:看完只需要记住哪一句话。
- 形式约束:时长、横竖屏、语言、是否要旁白、是否出镜。
- 必须保留的素材:人物参考图、产品图、Logo、链接或已有视频。
可以直接使用这个起步模板:
为我制作一条 30 秒竖屏短视频,面向第一次接触露营的年轻人。核心信息是“第一次露营只需要准备五样东西”。使用轻松、真实的户外风格,共 5 个镜头,中文旁白和中文字幕。先生成 Video Brief 和 Storyboard,不要直接生成最终视频。
第二步:让 Agent 先做 Brief,不要急着出片
Brief 的作用是锁定方向:视频目标、观众、叙事方式、视觉风格、节奏、角色、旁白和交付格式。先修改 Brief,比生成后推翻整条视频便宜得多。
第三步:检查 Storyboard
逐镜检查四件事:每一镜是否推动信息或剧情;相邻镜头是否重复;角色和场景是否连续;旁白长度是否能放进计划时长。发现问题时,直接要求 Agent “删掉第 3 镜”“把第 2 镜改成近景”“保持主角服装与第 1 镜一致”。
第四步:逐镜生成,再整体生成
先挑最关键、最难的一镜做测试。关键镜头能成立,再批量生成其他场景。这样可以尽早发现人物设定、画风或模型选择不合适,避免一次性消耗大量积分。
第五步:进入 Edit More 做最终控制
画布适合组织和生成,多轨编辑器适合精确剪辑。最终至少要检查:镜头长度、转场、旁白与画面对齐、字幕断句、音乐音量、首尾帧和导出比例。
先看“基础”教程熟悉入口、画布和生成按钮,再看“进阶”教程理解 Brief、Storyboard、逐镜修改和 Edit More 的完整衔接。
点击任一视频播放。
Seedance 2.0:先生成一个可用镜头
最短路径只有两步:打开 Video Studio,点击 Try Seedance 2.0;输入提示词并生成,结果会回到当前画布。入口如下。

一条可执行的视频提示词应该写什么
不要只写“一个人在雨里,很有电影感”。更稳定的结构是:
主体与外观 + 动作 + 环境 + 镜头运动 + 构图/景别 + 光线与风格 + 时间变化 + 禁止项
例如:
一名穿深灰色风衣的年轻女性站在夜晚的东京街口,雨水从霓虹灯牌前落下。她先低头看手机,随后抬头望向镜头外。摄影机从中景缓慢推进到近景,浅景深,湿润路面反射蓝紫色灯光,写实电影质感。保持人物脸部和服装稳定,不出现额外人物,不改变发型。
生成后按这个顺序修改:先看主体和动作是否正确,再看镜头运动,再看风格,最后才调小的美术细节。一次同时改十项,很难判断是哪一项让结果变好或变坏。
下面用卡通、科幻和电影感三类短片展示风格跨度。把它们当成提示词方向参考,不要把展示效果当成每次生成都能达到的固定质量。
点击视频播放;三段短样可单独循环查看。
图像与视频生成器:什么时候选哪种模式
Video Studio 可以在 Image 和 Video 模式之间切换。图像侧可能出现 Seedream、Nano Banana 等选择,视频侧可能出现 Dreamina Seedance、Sora、Veo 等选择;模型名单和数量会动态变化,直接按当前账号的模型菜单选择。


先分清:单镜头参数和完整视频时长不是一回事
| 对象 | 控制什么 | 当前界面可能出现的选项 | 第一次怎么选 |
|---|---|---|---|
| 单镜头生成 | 一次模型生成的一个片段 | 5、8、10、12、15 秒;720p;横屏、竖屏、方形等多种比例 | 先用 5–10 秒测试主体、动作和运镜,镜头成立后再延长 |
| 完整视频 | Brief 和 Storyboard 组装出的多场景成片 | 某些入口可选择 30 秒到 10 分钟 | 首作仍控制在 20–40 秒、3–5 镜头,确认一致性和积分消耗后再加长 |
单镜头的 15 秒上限不等于整条视频只能做 15 秒;完整视频的 10 分钟选项也不等于一次生成十分钟连续镜头。后者依靠多个场景、旁白、音乐和剪辑结构组成。分辨率、时长和比例会随模型、账号与入口变化,看到什么就按当前菜单执行。
选模型不要只看名字
- 图像侧:需要角色、商品或构图一致时,优先选强调一致性和多图编辑的模型;要一次探索多种方向时,优先选支持批量输入/输出的模型。
- 视频侧:没有参考素材时用文本生成;已有定稿首帧时用图像生成视频;需要继承人物、动作、运镜或声音节奏时,再选支持多参考或视频编辑的入口。
- 成本控制:先用短时长、较低分辨率验证提示词。主体和动作正确后,再提高分辨率或批量生成。
四种常见输入方式
| 模式 | 含义 | 适合什么任务 | 最容易出的问题 |
|---|---|---|---|
| t2i | 文本生成图像 | 概念图、风格探索、封面草图 | 人物或产品细节不稳定 |
| t2v | 文本生成视频 | 没有参考素材的全新镜头 | 主体、动作和运镜容易互相干扰 |
| i2v | 图像生成视频 | 让定稿角色、场景或产品图动起来 | 首帧好看但后续形变 |
| r2v | 参考素材生成视频 | 保持人物、风格、构图或多个对象关系 | 参考之间冲突,模型不知道优先级 |
使用多参考、多帧控制、故事板级编辑和批量生成时,要把“每份参考负责什么”写清楚。例如:“图 1 只参考人物脸部和服装,图 2 只参考构图,图 3 只参考动作。”如果入口允许加入视频或音频参考,可让视频负责动作与运镜,让音频负责节奏或声音方向;如果当前入口只允许图片,就不要在提示词里假设它能读取视频和音频。不要让多份参考同时争夺人物、动作、背景和风格。

Agent、Brief 与 Storyboard:把灵感变成结构
当你只有一个模糊想法时,Agent 的正确作用不是替你“写一条更长的提示词”,而是帮你把项目拆成可检查的中间产物。
Agent:用对话补齐缺失条件
你可以让它追问,而不是直接生成:
我想做一条关于独立咖啡店的 45 秒短片。先不要生成视频。请问我 6 个最关键的问题,帮助我确定观众、叙事角度、人物、风格、旁白和结尾行动。
回答后,再要求它总结为 Brief。若建议太泛,可以继续限定:“不要写品牌空话,每个镜头必须有可见动作”“开头 3 秒必须出现冲突”“全片只允许一个人物”。
Video Brief:先锁定方向
一份可用 Brief 至少包含:目标、受众、核心信息、时长、比例、叙事结构、角色与场景、视觉风格、旁白/音乐、必须出现与禁止出现的元素。Brief 是项目的验收标准,不是漂亮的创意说明。
Storyboard:把方向变成逐镜任务
Storyboard 每一镜至少要有:画面主体、动作、环境、景别或运镜、镜头时长、旁白/对白、转场关系。检查时问:删除这一镜后,信息或剧情是否受损?如果不受损,它大概率应该删掉或合并。
完整视频:怎样正确理解“30 秒到 10 分钟、一键生成”
如果当前账号可以选择 30 秒到 10 分钟的完整视频,第一次也不要直接做长片。先用 20–40 秒、3–5 个镜头跑通 Brief、Storyboard、生成和精剪;确认角色连续性、旁白同步和积分消耗都能接受,再逐段增加时长。具体可选时长以当前界面为准。
完整视频的推荐流程是:
- 从模板开始,或让 Agent 生成 Video Brief。
- 确认主题、受众、时长、画幅、角色、声音和视觉风格。
- 让 Agent 把 Brief 展开为 Storyboard。
- 逐镜检查信息与连续性,必要时修改角色、音乐、文字和旁白。
- 先生成关键镜头,再生成剩余场景。
- 在画布上替换失败镜头、缩短重复段落、补参考图。
- 预览全片;若只需轻量修改,可直接导出。
- 若要精确控制,点击 Storyboard 卡片中的 Edit More,进入多轨编辑器。



单个镜头坏了,按问题类型修,不要整条重做
- 人物变脸或服装漂移:回到该场景,重新指定角色参考,再执行角色重生成;只改人物,不要同时换场景和运镜。
- 画面内容选错:直接替换该镜头的媒体。已有素材选 My media,需要库存画面选 Stock media,需要重新生成选 AI media。
- 动作、风格或镜头语言不对:在场景下方的输入区改提示词、参考素材或生成模型,只重做这一镜。
- 旁白或出镜方式不对:回到 Brief/Storyboard 调整 Narrator、Avatar 或 Voice;音乐不合适则单独换 Music,不要用重新生成画面来解决声音问题。
- 局部修完后:先播放完整视频确认前后镜头衔接,再进入 Edit More 处理切点、字幕、混音和转场。
长视频更容易出现累积误差:角色脸部逐镜漂移、旁白和画面不同步、段落节奏重复、事实表述前后矛盾。片子越长,越需要分段验收,而不是更依赖一次性生成。
多模态画布:卡片既是素材,也是下一步操作入口
画布支持 Text、Image、Video、Link、Video Brief 和 Storyboard 等卡片。它们不是只供摆放的文件夹,而是可以继续触发操作的节点:文字可以继续改写和发展任务,图片和视频可以成为参考,链接可以保留外部页面上下文,Brief 可以继续调整制作参数,Storyboard 可以逐镜生成、替换和进入精剪。
点击录屏查看卡片操作;图片卡可点击放大。

六类卡片分别这样用:
- Text:保存需求、脚本段落、角色规则和修改记录;选中内容后继续交给 Agent 改写、展开或转成下一步任务。
- Image:作为人物、产品、场景、构图或风格参考;在提示词中写清它只负责哪一项。
- Video:预览已有片段,并作为动作、运镜、节奏或待替换镜头的输入。
- Link:把网页地址与当前项目并列保存,避免链接与素材分散;使用前仍要把需要提取的信息说清楚。
- Video Brief:集中修改 Style、Voice、Avatar、Duration 和 Aspect Ratio 等全片级设置。
- Storyboard:逐镜检查、生成和替换媒体,调整旁白与音乐,确认后从 Edit More 进入多轨编辑。
建议用下面的方式整理画布:
- 左侧放 Brief、角色设定和视觉参考,作为“不会频繁改动的基准”。
- 中间按场景顺序放 Storyboard 与生成结果。
- 右侧放被淘汰版本、备选镜头和需要进一步处理的素材。
- 用相邻的 Text 卡记录版本,例如
S03 夜景近景 v2|只换运镜|人物与服装不变;不要依赖缩略图猜哪一版改了什么。 - 同一角色的正面、侧面、服装和表情参考放在一起,并在提示词中说明各自用途。
画布能减少上下文丢失,但不能保证 Agent 自动理解每张图的优先级。输入中仍需明确“使用哪个对象、保留什么、修改什么、禁止改什么”。
六类进阶创作:分镜、角色、多图重组、批量组图、封面与风格
1. 漫画分镜
把故事拆成有明确动作的画面,并要求沿用参考图的角色和视觉风格。例如:机场候机 → 飞机上看窗外 → 抵达梦想学校。动作、地点和情绪都要发生变化,三张图才不是同一画面的重复。


2. 电影分镜
电影分镜除了人物和场景,还要写清镜头关系。示例任务是:使用两位参考女性角色,生成一段发生在夜间的“女刺客”电影分镜。实际输入时还应补充每镜景别、人物调度、光源和前后镜头的承接。

3. 角色设计与一致性测试
不要只让模型“生成同一个人”。更有效的任务是生成同一角色在六个角度、五个场景或八种风格中的设定图,再检查不可变化的身份特征:脸型、发型、服装主色、标志性配件和年龄感。

4. 多图重组
多图任务要声明每张图的职责。例如:“图 1 提供女性角色,图 2 提供男性角色,图 3 只提供姿势;把两人放进同一画面,不继承图 3 的人物外观。”这比笼统地说“把三张图合起来”更稳定。

5. 图像编辑与批量组图
已有一张接近可用的图时,不要从零重生。把修改拆成单一任务,例如“只把外套改成深蓝色,人物脸、姿势、背景和光线不变”。做角色设定、商品角度或一组社交配图时,先固定不变量,再批量改变角度、场景或风格;每轮只改变一个维度,方便判断哪一项导致一致性下降。
一个可执行的批量任务可以这样写:
使用同一位角色与同一套服装,生成 6 张 1:1 图片。人物脸、发型、衣服颜色和耳环保持一致;分别变化正面、左侧、右侧、半身、全身和坐姿。背景统一为浅灰摄影棚,不添加文字。
6. 视频封面与风格探索
封面必须先解决信息层级,再追求画面风格:主体是谁、标题放哪里、缩略图尺寸下是否还能认出、是否给平台 UI 留出安全区。可以先批量探索,再选一张进入 CapCut 添加真实文字;不要要求图像模型准确生成长标题。



风格库可以快速尝试写实、3D 卡通、未来科技、像素、黏土、赛博朋克和手绘动画等方向。预设适合探索;正式项目仍应把人物、色彩、材质、镜头和光线写成自己的视觉规范。








镜头运动与 VFX:把提示词写成可执行调度
运镜提示词最常见的失败,是只写术语,不写摄影机与主体的相对关系。“推进”究竟推向谁?“跟拍”从人物前方、侧面还是后方?“旋转”围绕哪个中心、旋转多少、同时是否升降?这些都要落到可见动作。
推荐结构:
摄影机起点 → 摄影机运动 → 跟踪对象 → 主体动作 → 环境变化 → 结束构图 → 速度与情绪
下面用六类代表性镜头拆解运镜。播放时重点观察:摄影机运动是否围绕一个明确对象,起点和终点是否都能描述。
点击各段视频播放,并与运镜说明逐项对照。
VFX 也要写成事件,而不是只写“加入炫酷特效”。说明特效何时出现、从哪里出现、如何影响人物和环境、何时结束。例如:“人物落地瞬间,地面裂纹从脚下向外扩散;蓝色能量沿裂纹亮起,碎石短暂悬浮,随后回落;镜头保持中远景。”
点击各段视频播放。
素材库与 Smart Edit:把生成结果包装成片
Video Studio 的优势不只在生成模型,还在于它能继续调用 CapCut 的声音、数字人、字幕、音乐、库存素材和自动包装能力。
Smart Edit 适合快速完成基础包装,例如高亮关键词、添加音乐、贴纸和效果。它节省的是机械操作时间,不能替代对节奏和信息层级的判断。







声音、数字人、字幕、克隆和积分策略会随账号与版本变化。开始正式制作前,先在当前菜单里确认可用项、费用和导出限制。
编辑、导出与发布前验收
生成结果不是成片。点击 Storyboard 卡片中的 Edit More 进入多轨编辑后,按下面顺序检查:
- 结构:开头 3–5 秒是否建立问题或冲突;每一镜是否必要;结尾是否完成信息或行动闭环。
- 画面连续性:人物脸、发型、服装、道具、方向、时间和天气是否突然变化。
- 剪辑节奏:镜头是否拖沓;动作是否在切点上完成;转场是否比内容更抢眼。
- 声音:旁白是否清楚;音乐是否压住人声;环境声是否突然断裂;不同片段响度是否一致。
- 字幕:错字、专名、数字、标点、断句和屏幕安全区是否正确。
- 事实与品牌:产品名称、数据、Logo、价格、人物身份和引用是否准确。
- 导出规格:横竖屏、分辨率、帧率、码率、封面和文件命名是否符合目标平台。
先看题材跨度,再看一条完整样片
同一工作区可以承载电影叙事、动画、科幻、艺术短片、知识解释、视觉营销、短剧和奇想实验。题材跨度说明的是工作流的适用范围,不是任何模型或账号的稳定质量承诺。








最稳妥的验收方法是:静音看一遍,只检查画面和字幕;闭眼听一遍,只检查旁白、音乐和节奏;最后在手机上完整播放一次,确认小屏阅读和平台裁切。
账号与版本不一致时怎么处理
下面这些项目会频繁变化,制作前直接在当前账号里确认:
- “300+ 免费积分”和“Seedance 2.0 免费使用 1 次”。
- “9 个模型”及具体的 Seedance、Sora、Veo、Nano Banana 等菜单。
- “完整视频 30 秒到 10 分钟”。
- “45+ 风格、300+ 声音、500+ 数字人、200+ 字幕”。
- 声音克隆、数字人克隆是否免费,以及不同功能的积分消耗。
不要拿固定数字倒推生产计划。先生成一个 10 秒测试镜头,记录可用模型、预计积分、生成耗时、分辨率和导出限制;测试通过后再批量生成。展示视频只用来学习结构、节奏和包装,不等于当前账号能以相同成本稳定复现同等质量。
直接入口:
如果只记住一条原则:先用 Agent 和 Storyboard 把结构做对,再用生成模型做镜头,最后用多轨编辑把它变成真正能发布的作品。
