日期与轮次: 2026-08-04 R2 arxiv: 2607.26611 video_kb 脚本: /shared/video-kb/scripts/tom/2026-08-04_R2_capa-coding-ambiguity-adaptation-short-video-script.md
1. 标题与观众
- 标题:CAPA · 跨会话编程消歧
- 目标观众:AI 工程师 / Coding Agent 技术产品经理 / 编程助手评测基准设计者
- 一句话核心观点:把跨会话个性化歧义单独拎出来打分,让少澄清 + 出对代码具备可量化靶子。
3. 45-90 秒口播稿
编程助手评测一直卡在 Pass@1。 今天要让同一用户跨会话不重复澄清。 CAPA 把跨会话个性化歧义单独拎出来打了一组基准。 600 个会话 × 60 个 balanced 单元格。 300 个 held-out 评测,300 个同用户历史喂回被测模型。 12 个近期 LLM 被同一组协议打分。 六类歧义机制覆盖缩进、库依赖、错误处理等真实风格指纹。 三阶段流水线先构造可执行基线,再注入偏好,得到歧义版本。 ground truth 是 T₀ 可执行解,不是 LLM 当裁判。 三个评估协议直接跑测试。 first-turn success 比 Pass@1 更敏感。 每少问一轮,平均省 500-1000 output tokens。 论文未开源仓库,gating 函数具体形式未明确。 跨会话不等于单会话,第十一视角补齐。
4. 镜头分镜
- 镜头 1(6s · 标题卡):屏幕文字
CAPA 跨会话编程消歧;画面元素 中央大字标题 + 右下论文编号小字;运动方式 轻微推近 + 标题淡入。 - 镜头 2(10s · 风险卡):屏幕文字
遗忘偏好 单会话视角 缺复合指标;画面元素 三栏痛点并排 + 红色描边;运动方式 三栏从左到右逐个点亮。 - 镜头 3(14s · 流程图):屏幕文字
600 60 12 LLM 三阶段受控生成;画面元素 左 600 会话 × 60 单元格均衡矩阵,右 T₀ → F_u → T₁ 流水线,中间 12 LLM 标识;运动方式 矩阵先入,流水线依序点亮,12 LLM 标记随后填入。 - 镜头 4(16s · 证据卡):屏幕文字
300 held-out 300 历史 ES FT-ES TTC;画面元素 四枚数字徽章排开,最后一枚标注 executable ground truth;运动方式 数字徽章逐个弹入,ground truth 徽章缓推。 - 镜头 5(14s · 风险卡):屏幕文字
仓库 0 命中 窗口未明 合成画像;画面元素 三行警示条 + 黄色描边;运动方式 警示条由浅入深推进。 - 镜头 6(16s · 行动清单):屏幕文字
加 gating 抄六类机制 可执行金标准;画面元素 三步清单竖排 + 序号加粗;运动方式 逐条向上展开。 - 镜头 7(14s · 落版卡):屏幕文字
跨会话 ≠ 单会话 · 第十一视角补齐;画面元素 底部条幅 + 左侧论文编号 + 右侧关键限定;运动方式 整体轻微上推并定版。