语音转文档Skill开发
000
画布
|大纲
内容详情
技术基础支撑
核心技术组件
- Whisper模型(OpenAI Whisper,实时语音识别模型)
- 实时功能特性
- 边讲边转写能力
- 基于OpenAI最新模型升级实现
- 后续将在设置中支持模型切换
- 原有功能保持不变不影响使用
- 边讲边转写能力
- 实时功能特性
- Codex(OpenAI Codex,代码生成执行模型)
- 命令行调用能力
- 文本处理核心工具
- 负责原始语音转写结果处理
- 替代原有Gemini实现全流程执行
- 文本处理核心工具
- 命令行调用能力
- Cron Tab(定时任务工具,系统定时调度组件)
- 定时调度能力
- 每日触发执行逻辑
- 每日零点自动触发全流程任务
- 配置前自动备份原有定时任务
- 仅追加配置不覆盖用户原有任务
- 每日触发执行逻辑
- 定时调度能力
数据源对接规则
- 语音源唯一来源
- 苹果语音备忘录(Voice Memo)
- 完全不调用Mac系统其他录音接口
- 采用rsync同步语音备忘录文件
- 苹果语音备忘录(Voice Memo)
功能流程设计
每日自动执行管线
- 第一步:音频同步与转写
- 调用ASR(Automatic Speech Recognition,自动语音识别)管线
- 输出格式要求
- 直接输出结构化CSV文件
- 无需说话人识别简化流程
- 输出格式要求
- 调用ASR(Automatic Speech Recognition,自动语音识别)管线
- 第二步:内容智能处理
- 调用Codex命令行工具
- 两类输出产物
- 格式化HTML文件(可由MD编译生成)
- meetings文件夹存储单会议独立输出
- 两类输出产物
- 调用Codex命令行工具
- 第三步:内容结构化输出
- HTML文件核心内容
- 基础信息模块
- 当日整体事件汇总摘要
- 待办项(Action Items)清单
- 会议处理模块
- 自动拆分识别到的独立会议
- 对应输出到meetings子文件夹
- 基础信息模块
- HTML文件核心内容
Skill标准化配置
安装配置流程
- 整体分发方式
- 公开GitHub仓库
- 用户可直接将仓库地址发送给AI
- AI自动读取README完成克隆安装
- 公开GitHub仓库
- AI引导配置步骤
- 环境配置
- 自动配置Python运行环境
- 内置极简M4A测试文件验证流程
- 验证Codex命令行可正常调用
- 定时任务配置
- AI自动完成Cron Tab配置
- 配置前自动备份原有定时任务
- 提醒用户保持Voice Memo常开
- 环境配置
项目文件结构
- 标准Skill目录
- 必备文档
- README.md(英文编写,说明安装使用方法)
- PRD(Product Requirements Document,产品需求文档,英文)
- RFC(Request For Comments,功能征求意见稿,英文)
- 核心代码
- 定时调用的Python执行脚本
- ASR处理模块封装
- Codex调用逻辑封装
- HTML生成模板文件
- 必备文档
落地执行步骤
前期准备阶段
- 第一步:前期调研
- 需求与技术验证
- 梳理现有相关Skill逻辑参考
- 确认各组件接口调用规范
- 需求与技术验证
- 第二步:项目脚手架搭建
- 目录与文档初始化
- 建立完整Skill文件夹结构
- 完成PRD、RFC英文文档编写
- 中文需求直译英文不做缩写
- 目录与文档初始化
开发测试阶段
- 第三步:CLI开发
- 命令行工具实现
- 设计并实现全流程CLI工具
- 完成功能测试确保流程跑通
- 更新相关功能说明文档
- 命令行工具实现
- 第四步:流程验证
- 全链路自测
- 生成10秒TTS测试音频文件
- 跑完从同步到输出完整流程
- 全链路自测
- 第五步:文档完善
- 说明文档补全
- 完成README等全量文档编写
- 补充配置、使用步骤说明
- 说明文档补全
上线发布阶段
- 第六步:安全校验
- 隐私安全检查
- 排查移除敏感隐私信息
- 确认无安全漏洞风险
- 隐私安全检查
- 第七步:GitHub发布
- 仓库初始化推送
- 创建公开GitHub仓库
- 提交master分支完整代码
- 完成仓库首次推送 :::label ["语音转写工具开发", "AI自动化Skill", "语音备忘录处理"] :::
- 仓库初始化推送
