思维链(CoT)与强化学习(RL)在视频理解中的最新突破

AAI脑图#5109222025-09-25 02:50
12300

内容详情

背景与核心概念

思维链(CoT)生成技术

  • 通俗解释
    • 让模型“自言自语”地写出中间步骤,像人类解题一样先列草稿再得答案
  • 技术演进
    • 零样本CoT → 少样本CoT → 自洽性解码 → 自动CoT提示 → 基于验证器的CoT
  • 最新关联
    • 2024年Google提出“CoT-Compress”缩短推理链长度30%不减准确率

强化学习(RL)作为训练后方法

  • 通俗解释
    • 模型像玩游戏一样试错,靠“奖励分数”自己摸索出更优策略,而非死记硬背答案
  • 关键算法
    • PPO → RLHF → DPO → RLAIF → 离线RL(如CQL、IQL)
  • 2024趋势
    • 规则奖励模型(Rule-Based Reward)替代人类标注,降低70%标注成本

多模态大模型(MLLM)的推理潜力

  • 继承CoT能力
    • 文本CoT → 图文交错CoT → 视频帧序列CoT
  • 未充分探索的痛点
    • “看得懂”却“推不动”:感知与逻辑脱节,长视频因果链丢失

SEED-Bench-R1基准全景

设计目标

  • 系统评估MLLM训练后方法
    • 聚焦“真实日常规划”任务,替代传统“识别+字幕”浅层评测

数据集特色

  • 真实复杂视频
    • 来源:YouTube第一视角Vlog、家庭GoPro、厨房/车库/办公室长镜头
  • 复杂日常规划任务
    • 示例:给定“做提拉米苏”视频,回答“若缺少马斯卡彭,哪步需最先调整?”
  • 三级层级评估
    • 分布式(同场景换对象)→ 跨环境(厨房→露营)→ 跨任务(做菜→修车)

规模与格式

  • 多项选择题
    • 每题4-5选项,含时间戳定位,平均视频时长2.3分钟
  • 易验证真实答案
    • 配套可执行Python脚本+众包人工复核,确保答案唯一性
  • 训练/测试划分
    • 训练集48k、验证集6k、测试集6k,比例8:1:1,防泄漏哈希切片

实验设置与结果

基础模型

  • Qwen2-VL-Instruct-7B
    • 2024年9月开源,原生支持32帧输入,平均推理速度比LLaVA-Next快1.7倍

对比方案

  • 监督微调(SFT)
    • 交叉熵损失+LoRA秩=64,3epoch,学习率2e-4
  • 强化学习(RL)
    • 规则奖励=答案正确性+格式合规性,PPO裁剪阈值0.2,batch=256

性能结论

  • 分布内任务
    • RL准确率78.4% vs SFT 74.1%,数据效率提升40%(达同等性能仅需60%样本)
  • 分布外任务
    • RL准确率65.7% vs SFT 58.3%,跨环境泛化差距扩大7.4%
  • 通用视频理解
    • LongVideoBench零样本提升2.1 BLEU,证明迁移能力不限于规划任务

深度分析:RL的“副作用”

视觉感知增强

  • 帧检索精度↑
    • RL模型在“找关键帧”子任务F1提升4.6%,因奖励函数显式鼓励定位

逻辑连贯性下降

  • 推理链碎片化
    • 案例:回答“为何先加盐后加醋”时,RL模型给出“加盐→奖励高→继续加盐”循环
  • 自洽性降低
    • 同一视频问3次,RL模型答案一致性从SFT的91%降至77%

根本原因

  • 稀疏奖励陷阱
    • 只有最终答案得分,中间推理步骤无细粒度监督,导致“抄近路”
  • 视觉线索被忽略
    • 奖励只关注文本答案,模型学会“跳过帧”凭先验知识猜答案

未来改进路线图

基础模型层面

  • 引入“可验证中间标签”
    • 每帧自动生成子目标标签(如“水开”“鸡蛋打散”),供密集奖励使用
  • 视频CoT缓存机制
    • 先让模型生成文字脚本,再基于脚本做推理,降低长视频记忆压力

奖励建模层面

  • 细粒度规则奖励
    • 感知奖励(对象定位IoU)+ 逻辑奖励(步骤顺序合法性)+ 简洁奖励(token长度惩罚)
  • 混合人类-规则反馈
    • 用“AI评委”先筛,人类只复核边界案例,降低90%标注量

鲁棒性层面

  • 噪声标签自校正
    • 采用“置信度过滤+迭代重标注”,在48k训练集中自动修正3.2%错误答案
  • 对抗扰动训练
    • 在视频帧中植入文本对抗补丁,强迫模型同时依赖视觉与语义,减少“先验投机”

产业与学术影响

学术方向

  • 后训练时代范式
    • “预训练→SFT→RL”三步走成为MLLM新标准,替代纯SFT

工业落地

  • 具身智能
    • 家庭服务机器人可借助RL-CoT在真实厨房快速学会“看-想-做”闭环

评测生态

  • 下一代基准
    • 2025年预计出现“SEED-Bench-R2”加入音频模态与实时交互,推动持续演进