思维链(CoT)与强化学习(RL)在视频理解中的最新突破
12300
画布
|大纲
内容详情
背景与核心概念
思维链(CoT)生成技术
- 通俗解释
- 让模型“自言自语”地写出中间步骤,像人类解题一样先列草稿再得答案
- 技术演进
- 零样本CoT → 少样本CoT → 自洽性解码 → 自动CoT提示 → 基于验证器的CoT
- 最新关联
- 2024年Google提出“CoT-Compress”缩短推理链长度30%不减准确率
强化学习(RL)作为训练后方法
- 通俗解释
- 模型像玩游戏一样试错,靠“奖励分数”自己摸索出更优策略,而非死记硬背答案
- 关键算法
- PPO → RLHF → DPO → RLAIF → 离线RL(如CQL、IQL)
- 2024趋势
- 规则奖励模型(Rule-Based Reward)替代人类标注,降低70%标注成本
多模态大模型(MLLM)的推理潜力
- 继承CoT能力
- 文本CoT → 图文交错CoT → 视频帧序列CoT
- 未充分探索的痛点
- “看得懂”却“推不动”:感知与逻辑脱节,长视频因果链丢失
SEED-Bench-R1基准全景
设计目标
- 系统评估MLLM训练后方法
- 聚焦“真实日常规划”任务,替代传统“识别+字幕”浅层评测
数据集特色
- 真实复杂视频
- 来源:YouTube第一视角Vlog、家庭GoPro、厨房/车库/办公室长镜头
- 复杂日常规划任务
- 示例:给定“做提拉米苏”视频,回答“若缺少马斯卡彭,哪步需最先调整?”
- 三级层级评估
- 分布式(同场景换对象)→ 跨环境(厨房→露营)→ 跨任务(做菜→修车)
规模与格式
- 多项选择题
- 每题4-5选项,含时间戳定位,平均视频时长2.3分钟
- 易验证真实答案
- 配套可执行Python脚本+众包人工复核,确保答案唯一性
- 训练/测试划分
- 训练集48k、验证集6k、测试集6k,比例8:1:1,防泄漏哈希切片
实验设置与结果
基础模型
- Qwen2-VL-Instruct-7B
- 2024年9月开源,原生支持32帧输入,平均推理速度比LLaVA-Next快1.7倍
对比方案
- 监督微调(SFT)
- 交叉熵损失+LoRA秩=64,3epoch,学习率2e-4
- 强化学习(RL)
- 规则奖励=答案正确性+格式合规性,PPO裁剪阈值0.2,batch=256
性能结论
- 分布内任务
- RL准确率78.4% vs SFT 74.1%,数据效率提升40%(达同等性能仅需60%样本)
- 分布外任务
- RL准确率65.7% vs SFT 58.3%,跨环境泛化差距扩大7.4%
- 通用视频理解
- LongVideoBench零样本提升2.1 BLEU,证明迁移能力不限于规划任务
深度分析:RL的“副作用”
视觉感知增强
- 帧检索精度↑
- RL模型在“找关键帧”子任务F1提升4.6%,因奖励函数显式鼓励定位
逻辑连贯性下降
- 推理链碎片化
- 案例:回答“为何先加盐后加醋”时,RL模型给出“加盐→奖励高→继续加盐”循环
- 自洽性降低
- 同一视频问3次,RL模型答案一致性从SFT的91%降至77%
根本原因
- 稀疏奖励陷阱
- 只有最终答案得分,中间推理步骤无细粒度监督,导致“抄近路”
- 视觉线索被忽略
- 奖励只关注文本答案,模型学会“跳过帧”凭先验知识猜答案
未来改进路线图
基础模型层面
- 引入“可验证中间标签”
- 每帧自动生成子目标标签(如“水开”“鸡蛋打散”),供密集奖励使用
- 视频CoT缓存机制
- 先让模型生成文字脚本,再基于脚本做推理,降低长视频记忆压力
奖励建模层面
- 细粒度规则奖励
- 感知奖励(对象定位IoU)+ 逻辑奖励(步骤顺序合法性)+ 简洁奖励(token长度惩罚)
- 混合人类-规则反馈
- 用“AI评委”先筛,人类只复核边界案例,降低90%标注量
鲁棒性层面
- 噪声标签自校正
- 采用“置信度过滤+迭代重标注”,在48k训练集中自动修正3.2%错误答案
- 对抗扰动训练
- 在视频帧中植入文本对抗补丁,强迫模型同时依赖视觉与语义,减少“先验投机”
产业与学术影响
学术方向
- 后训练时代范式
- “预训练→SFT→RL”三步走成为MLLM新标准,替代纯SFT
工业落地
- 具身智能
- 家庭服务机器人可借助RL-CoT在真实厨房快速学会“看-想-做”闭环
评测生态
- 下一代基准
- 2025年预计出现“SEED-Bench-R2”加入音频模态与实时交互,推动持续演进
