ScreenKite AI 剪辑教程:从录屏到自动生成 B-roll 的完整流程
一篇手把手的教程,展示如何用 ScreenKite 的 AI 功能自动剪口播、去除静默片段、生成 B-roll,包含环境配置、操作步骤和实际效果数据。
ScreenKite AI 剪辑教程:从录屏到自动生成 B-roll 的完整流程
上一篇文章我们介绍了 ScreenKite 的 AI 剪辑功能。
这篇文章会更具体。我们会从头到尾走一遍完整的 AI 剪辑流程,包括:
- 你需要提前准备什么
- 怎么用 AI 自动剪口播
- 怎么用 AI 自动生成 B-roll
- 每一步实际发生了什么
如果你想知道这个功能到底怎么用,这篇就是答案。
开始之前:你需要准备什么
ScreenKite 的 AI 剪辑功能依赖几个外部工具。在开始之前,请确保你已经准备好以下内容。
1. 安装 ScreenKite
从 screenkite.com 下载并安装 ScreenKite。
2. 安装一个 AI 编码工具
ScreenKite 的 AI 剪辑功能通过 AI 编码工具来驱动。你可以选择你习惯的工具,比如:
- Claude Code
- OpenAI ChatGPT Codex
- Antigravity
- Grok Build
- Kimi
这些工具在你的本地运行,ScreenKite 提供它们可以调用的命令接口。
3. 配置语音转录(用于剪口播)
自动剪口播功能需要对录音进行语音转录。你有两种选择:
方式一:使用 ElevenLabs API
在你的项目目录中创建一个 .env 文件,添加:
ELEVEN_LABS_API_KEY=你的API密钥
方式二:使用本地 WhisperKit 模型
在 ScreenKite 的 设置 → 转录 中下载一个 WhisperKit 模型。这样可以完全离线使用,不需要 API Key。
4. 安装 B-roll 生成依赖(如需使用)
如果你想自动生成 B-roll,还需要确保系统有以下环境:
- Node.js(用于 Remotion 渲染)
- uv(Python 包管理工具)
第一步:录制视频
打开 ScreenKite,录制你的屏幕视频。
录制完成后,你会得到一个 .skbundle 文件。这就是 ScreenKite 的项目文件,包含了你的屏幕录制、摄像头画面和音频。
第二步:用 AI 打开项目
进入 ScreenKite 的编辑器,点击左上角的 AI Agent 按钮。
此时,你的 AI 工具(比如 Claude Code)会自动连接到 ScreenKite 项目。
AI 会读取你的项目信息,包括:
- 视频时长
- 有哪些轨道(屏幕录制、摄像头、麦克风、系统音频)
- 已经有的缩放效果数量
- 覆盖层和字幕轨道状态
这一步让 AI 了解你的视频结构,为后续操作做准备。
第三步:自动剪口播
告诉 AI 你想做什么
用自然语言说:
"帮我去掉静默片段和口头禅。"
AI 会做什么
导出音频并转录:AI 会提取你的麦克风音轨,发送到 ElevenLabs(或 WhisperKit)进行逐词转录。
检测静默片段:分析音频波形,找出明显的停顿(dead air)。
检测口头禅:在转录文本中寻找 "嗯"、"啊"、"然后" 等口头禅词汇。
预览剪切方案:AI 不会直接剪切,而是先给你一个预览列表。
实际效果
以一段 95 秒的录音为例,AI 检测到:
- 2 处静默片段,总共约 2.5 秒
- 第一处:28.4 秒 → 29.0 秒(0.5 秒停顿)
- 第二处:70.5 秒 → 72.5 秒(1.9 秒停顿)
- 口头禅:0 处(录音本身很干净)
确认并应用
你可以说 "cut" 或 "应用",AI 就会把这些剪切应用到时间线上。
结果:95.04 秒 → 92.56 秒,去掉了约 2.5 秒的无用片段。
整个过程不需要你手动找时间点、不需要一帧帧对齐。
第四步:自动生成 B-roll
这是更进阶的功能。
告诉 AI 你想做什么
用自然语言说:
"我想根据视频内容生成一些 B-roll。"
AI 分析你的内容
AI 会先分析你的视频转录稿,理解你在讲什么。
然后,它会把你的视频按时间段分成几个 "Beat"(内容节拍),并为每个节拍规划合适的 B-roll 类型。
比如,假设你在录制一个产品演示,AI 可能会这样分析:
- Beat A(0-28 秒):开场介绍 → 建议添加频道名牌、产品类别标签
- Beat B(29-36 秒):功能说明 → 建议添加功能限制卡片
- Beat C(36-70 秒):核心功能展示 → 建议添加关键词芯片、定时器标签、模式切换组件
- Beat D(72-95 秒):总结和反馈 → 建议添加待办列表卡片
选择 B-roll 密度
AI 会给你三个密度方案:
Sparse(精简) : 4 个关键视觉元素
- 风格干净,像纪录片
- 适合内容本身已经很清晰的视频
Medium(均衡) : 7 个元素
- 默认推荐方案
- 平衡视觉丰富度和简洁度
Dense(丰富) : 10 个元素
- 适合教学/解说类视频
- 视觉信息量大,帮助观众理解复杂内容
你只需要说出你想要的密度,比如 "sparse" 或 "用精简方案"。
AI 并行生成 B-roll
选定方案后,AI 会同时启动多个子任务,并行构建每个 B-roll slot。
每个 slot 包括:
- 一段 Remotion 组件代码(定义了视觉样式、动画、文字内容)
- 渲染输出为
.mp4视频文件 - 放置参数(时间窗口、屏幕位置、大小)
应用到时间线
渲染完成后,AI 会自动把 B-roll 放到 ScreenKite 的 Overlay 轨道上。
以 Sparse 方案为例,最终效果:
- Slot 01:频道名牌 → 2.0-5.6 秒,左下角
- Slot 02:功能限制卡片 → 29.5-34.5 秒,右上角
- Slot 03:关键词功能芯片 → 42.0-47.0 秒,左上角
- Slot 04:待办列表卡片 → 73.0-78.0 秒,右上角
所有 B-roll 都带有 magicMove 过渡动画,看起来像是精心设计的,而不是简单粘贴上去的。
整个过程需要多长时间
根据实际测试:
- 打开项目 + AI 分析:约 1 分钟
- 剪口播(转录 + 检测 + 应用):约 2 分钟
- B-roll 生成(分析 + 构建 + 渲染 + 应用,4 个 slot):约 5 分钟
一段 95 秒的录屏视频,从原始录制到完成 AI 剪辑,总共大约 8 分钟。
如果手动完成同样的工作,预计需要 30 分钟以上。
AI 校对能力
一个有趣的细节:AI 在分析你的内容时,会自动校对产品名称。
比如,当语音识别把某个产品名称识别错误时(例如把 "ReplyHunt" 听成了 "V share"),AI 能够通过上下文判断这是一个误识别,并在生成 B-roll 时使用正确的名称。
这意味着即使你的语音转录不完美,最终的 B-roll 内容依然是准确的。
关于隐私
整个过程中:
- 视频文件始终在你的本地
- AI 工具在你的电脑上运行
- 转录数据存储在你的项目目录中
- B-roll 的渲染也在本地完成
唯一的外部通信是语音转录(如果你用 ElevenLabs API)。如果你选择 WhisperKit,那就是完全离线的。
总结
ScreenKite 的 AI 剪辑不是一个黑盒子。
它让你用自然语言和 AI 工具协作完成视频剪辑,每一步都可以预览、可以调整。
如果你经常做录屏教程、产品演示或软件分享视频,这个流程可以帮你把重复的剪辑工作从 30 分钟压缩到不到 10 分钟。
更多时间留给内容本身,更少时间浪费在重复操作上。
下载 ScreenKite,试试看。
Related articles
如何在 Mac 上录制带音频的屏幕(系统音频 + 麦克风)
Mac 屏幕录制同时捕获系统音频和麦克风的完整指南。内建方法、免费替代方案以及原生支持的应用。
2026 年 Mac 屏幕录制完全指南(内建工具 + 更好的选择)
了解如何使用 Command-Shift-5、QuickTime 或专业录屏工具在 Mac 上进行屏幕录制。涵盖音频、权限、编辑和导出。
在本地时间线剪 Tella 的 Mac 录屏(不必进云端编辑器)
Tella 的 Mac 应用可原生录制,但剪辑常落到网页编辑器。若你要在 Mac 上完成捕捉、多轨剪辑和本地导出,优先考虑 ScreenKite。