调 RAG 别再盲搜 · Agentic AutoRAG · 2610-08452 · 短视频脚本镜像
- 日期 / 轮次:2026-10-08 / R2(中午棒)
- arXiv 链接:https://arxiv.org/abs/2610.08452
- video-kb 脚本原路径:
/shared/video-kb/scripts/tom/2026-10-08_R2_agentic-autorag_short-video-script.md
1. 标题与观众
- 标题:调 RAG 别再盲搜
- 目标观众:企业 RAG 平台工程师 + LLM-agent / HPO 研究者 + Cost-aware LLM 部署工程师 + 技术产品经理
- 一句话核心观点:把 RAG 调优从盲搜标量分升级为显式归因 + 知识库约束 + Pareto 多目标。
3. 45-90 秒口播稿
(开场 0-4 秒)调 RAG 是组合优化。今天拆一个把它从盲搜换成对话式调优的论文。 (第一段 4-16 秒)Agentic AutoRAG,论文全名 RAG Pipeline Optimization through Reasoning-Driven Agents。作者 Lasse B. Strand,10 月 6 日 v1 投稿。 (第二段 16-28 秒)每次 trial 跑完,Diagnoser 判断错题是检索错还是生成错。Proposer 根据模型排名和定价知识库,选下一组配置。 (第三段 28-40 秒)在 frozen exam 上迭代,沿 Pareto 前沿权衡准确率和成本。前 10 次 trial,就能顶 baseline 跑满 30 次的 judge 准确率。 (第四段 40-52 秒)真实医疗语料 cost-aware 模式:中位准确率 77%,baseline 71.5%。在匹配 baseline 精度下,成本压到约 22%。 (第五段 52-64 秒)双 workshop 接收:EMNLP 2026 REALM,NeurIPS 2026 ML4Systems。代码公开在 GitHub Agentic-Systems-Lab 仓库。 (收尾 64-72 秒)今天能带走的:调 RAG 别再盲搜。把失败归因拆开,把模型定价放知识库,沿 Pareto 前沿压成本。
4. 镜头分镜
- 镜头 1(0-8s · 开场):屏幕文字「调 RAG 别再盲搜」· 大号 hero H1 标题卡 · 静态居中淡入
- 镜头 2(8-20s · 关键判断):屏幕文字「三个判断点」· 5 项关键数字面板(77% / 71.5% / 58% / 22% / 10 vs 30 trial)· 数字依次浮现
- 镜头 3(20-32s · 机制):屏幕文字「Diagnoser 拆归因 · Proposer 选配置」· 箭头流程图(trial → Diagnoser → Proposer → frozen exam 迭代)· 节点顺次高亮
- 镜头 4(32-44s · Pareto):屏幕文字「accuracy vs cost」· 双栏对比 + Pareto 曲线 + 「22% cost at 71.5%」点标注 · 曲线绘制 + 焦点缩放
- 镜头 5(44-56s · 真实语料 ROI):屏幕文字「医疗语料 · 77% vs 71.5%」· 双柱状图 baseline vs Agentic AutoRAG · 柱体并排上升
- 镜头 6(56-64s · 工程反思):屏幕文字「Diagnoser 可靠性 · judge 偏差 · 域偏窄」· 风险卡 · 三条警示依次出现
- 镜头 7(64-72s · 收尾):屏幕文字「调 RAG 别盲搜」· 行动清单 + 双 workshop 徽标 · 静态收尾 + 渐隐