Claude Video工具介绍
000
画布
|大纲
内容详情
项目基础信息
项目定位
- 核心功能
- 为Claude新增/watch能力
- 支持YouTube等在线视频链接处理替代传统仅读取字幕/简介的局限
- 替代传统仅读取字幕/简介的局限
- 支持本地视频文件分析可结合画面+音频内容综合回答
- 可结合画面+音频内容综合回答
- 支持YouTube等在线视频链接处理替代传统仅读取字幕/简介的局限
- 为Claude新增/watch能力
- 开发者
- Brad Bonanno开发的开源项目
- GitHub星数约6.8k,近期关注度较高开源地址:https://github.com/bradautomates/claude-video
- 开源地址:https://github.com/bradautomates/claude-video
- GitHub星数约6.8k,近期关注度较高开源地址:https://github.com/bradautomates/claude-video
- Brad Bonanno开发的开源项目
核心优势
- 多模态内容分析
- 同时参考字幕与视频帧
- 区别于普通工具仅转文字的逻辑回答更贴近实际观看视频的效果
- 回答更贴近实际观看视频的效果
- 区别于普通工具仅转文字的逻辑回答更贴近实际观看视频的效果
- 同时参考字幕与视频帧
- 适配多模态大模型
- 针对Claude特性设计流程
- 将视频拆为模型可识别的图文材料降低大模型原生视频处理的门槛
- 降低大模型原生视频处理的门槛
- 将视频拆为模型可识别的图文材料降低大模型原生视频处理的门槛
- 针对Claude特性设计流程
安装与使用方法
安装步骤
- 核心安装方式
- 向Claude Code发送指定提示词
- 提示词内容:帮我安装这个skill:https://github.com/bradautomates/claude-video无需手动配置复杂环境
- 无需手动配置复杂环境
- 提示词内容:帮我安装这个skill:https://github.com/bradautomates/claude-video无需手动配置复杂环境
- 向Claude Code发送指定提示词
- 依赖自动检查
- 首次运行检测必备工具
- 自动检查ffmpeg和yt-dlp环境macOS通过Homebrew自动安装,其他系统给出安装命令
- macOS通过Homebrew自动安装,其他系统给出安装命令
- 自动检查ffmpeg和yt-dlp环境macOS通过Homebrew自动安装,其他系统给出安装命令
- 可选依赖配置
- 无字幕视频需配置Whisper API Key优先支持Groq,也兼容OpenAI接口
- 优先支持Groq,也兼容OpenAI接口
- 无字幕视频需配置Whisper API Key优先支持Groq,也兼容OpenAI接口
- 首次运行检测必备工具
使用示例
- 指令格式
- 在线视频指令
- 格式:/watch 视频链接 指令内容示例:/watch https://youtu.be/xxx 总结这个视频
- 示例:/watch https://youtu.be/xxx 总结这个视频
- 格式:/watch 视频链接 指令内容示例:/watch https://youtu.be/xxx 总结这个视频
- 本地视频指令
- 格式:/watch 本地视频路径 指令内容示例:/watch ~/Movies/screen-recording.mp4 找xx相关画面
- 示例:/watch ~/Movies/screen-recording.mp4 找xx相关画面
- 格式:/watch 本地视频路径 指令内容示例:/watch ~/Movies/screen-recording.mp4 找xx相关画面
- 在线视频指令
- 使用流程
- 前置参数确认
- 运行前询问帧密度、是否分析字幕等需求根据用户需求调整处理精度
- 根据用户需求调整处理精度
- 运行前询问帧密度、是否分析字幕等需求根据用户需求调整处理精度
- 结果输出
- 可生成图文笔记、Word文档等形式输出6分钟视频可输出逻辑顺畅的整合内容
- 6分钟视频可输出逻辑顺畅的整合内容
- 可生成图文笔记、Word文档等形式输出6分钟视频可输出逻辑顺畅的整合内容
- 前置参数确认
核心实现原理
基础处理流程
- 视频源处理
- 调用yt-dlp工具解析源
- 支持YouTube、TikTok、X、Instagram等平台兼容本地mp4、mov、mkv、webm格式
- 兼容本地mp4、mov、mkv、webm格式
- 支持YouTube、TikTok、X、Instagram等平台兼容本地mp4、mov、mkv、webm格式
- 调用yt-dlp工具解析源
- 字幕优先获取
- 优先读取视频自带字幕
- 仅需文字总结时无需下载音视频降低处理成本,提升响应速度
- 降低处理成本,提升响应速度
- 仅需文字总结时无需下载音视频降低处理成本,提升响应速度
- 优先读取视频自带字幕
- 音视频按需下载
- 分析画面或无字幕时下载内容
- 根据用户指令判断是否需要完整资源避免不必要的带宽和存储消耗
- 避免不必要的带宽和存储消耗
- 根据用户指令判断是否需要完整资源避免不必要的带宽和存储消耗
- 分析画面或无字幕时下载内容
- 视频帧提取
- 调用ffmpeg实现抽帧
- 支持efficient/balanced/token-burner三种模式分别对应关键帧提取、场景变化帧提取等策略
- 分别对应关键帧提取、场景变化帧提取等策略
- 支持efficient/balanced/token-burner三种模式分别对应关键帧提取、场景变化帧提取等策略
- 调用ffmpeg实现抽帧
- 无字幕音频转录
- 调用Whisper模型转文字
- 支持Groq的whisper-large-v3和OpenAI的whisper-1生成带时间戳的字幕内容
- 生成带时间戳的字幕内容
- 支持Groq的whisper-large-v3和OpenAI的whisper-1生成带时间戳的字幕内容
- 调用Whisper模型转文字
- 材料整合提交
- 字幕+帧一同传给Claude
- 大模型综合多模态信息生成回答输出结果兼顾画面与语音信息
- 输出结果兼顾画面与语音信息
- 大模型综合多模态信息生成回答输出结果兼顾画面与语音信息
- 字幕+帧一同传给Claude
Token成本控制
- 帧预算机制
- 根据视频时长调整抽帧密度
- 短视频帧密度更高,长视频自动稀疏10分钟以上视频默认限制约100帧
- 10分钟以上视频默认限制约100帧
- 短视频帧密度更高,长视频自动稀疏10分钟以上视频默认限制约100帧
- 根据视频时长调整抽帧密度
- 重复帧过滤
- 自动剔除近似重复的画面
- 适配屏幕录制、PPT课程等静态画面多的场景将token预算优先分配给变化的画面
- 将token预算优先分配给变化的画面
- 适配屏幕录制、PPT课程等静态画面多的场景将token预算优先分配给变化的画面
- 自动剔除近似重复的画面
适用场景
核心适用场景
- 需结合图文的内容处理
- 爆款短视频分析
- 同时分析画面呈现和口播内容完整梳理视频爆点逻辑
- 完整梳理视频爆点逻辑
- 同时分析画面呈现和口播内容完整梳理视频爆点逻辑
- 视频学习笔记整理
- 同步提取知识点画面和讲解内容生成的笔记信息更完整
- 生成的笔记信息更完整
- 同步提取知识点画面和讲解内容生成的笔记信息更完整
- 爆款短视频分析
基础适用场景
- 普通视频内容总结
- 替代纯字幕总结工具
- 输出结果准确性更高避免仅靠字幕产生的信息偏差
- 避免仅靠字幕产生的信息偏差
- 输出结果准确性更高避免仅靠字幕产生的信息偏差
- 替代纯字幕总结工具
