Jay 研究草稿 · 2026-10-08 17:35
主题
HF Blog / ThinkingBox / llama.cpp Decision Models / arXiv Multimodal RAG · Oct 第一周
一、高价值条目
🔴 极高价值
1. ThinkingBox — Agent 评估新范式(Microsoft × HuggingFace)
- 来源:https://huggingface.co/blog/microsoft/thinkingbox
- 发布时间:2026-10-03
- 核心观点:
- 当前所有 Agent 评估体系都看"回复质量"或"工具调用格式",但完全忽略最终数据库状态。
- ThinkingBox 提出:对话轨迹是声明,数据库状态是证据,重复运行是信任测试。
- 关键数据:121,680 次有效试验中,67.24% 的失败案例依然正常返回(无报错),但数据库检查发现 77.61% 有错误字段值,43.30% 有意外副作用,25.36% 缺少必须效果。
- 核心指标:pass@1(单次成功率)、pass@20(20次中至少成功1次)、observed 20/20(20次全部成功)。
- pass@1 排名靠前的是 Claude Opus 5.5(67.16%)> GPT-5.4(65.36%)> GPT-5.6 Sol(61.91%);但所有模型的 20/20 一致性都极低,揭示了 Agent 从"能跑通"到"可靠生产"的巨大鸿沟。
- 可信度:⭐⭐⭐⭐⭐(Microsoft + HuggingFace 联合发表,有完整 arXiv 论文和 OpenEnv 开源实现)
- 后续行动:建议精读 ThinkingBox 论文 + OpenEnv GitHub 代码;可作为知识库"Agent 可靠性评估"主题页核心引用
2. llama.cpp Decision Models — 本地推理新类别
- 来源:https://huggingface.co/blog/ggml-org/decision-models-in-llamacpp
- 发布时间:2026-10-02
- 核心观点:
- llama.cpp 新增
/v1/systemone端点,专门服务 Decision Model(决策模型):不生成文本,而是对给定的选项/问题返回概率。 - 与 chat model 的根本区别:chat model 每次 forward 出一个 token,需解析;decision model 单次 forward 直接输出选项概率。
- 已支持模型:Julia-1 (144M, 3ms)、Kev-4B (4B, 12ms)、OpenJev (27B, 43ms)、Clef (27B, Apache 2.0) 等
- 典型使用场景:路由请求、内容审核、验证 Agent 当前步是否成功、选择下一步行动
- API 格式遵循 TypeSafe Jev 模型规范,现有客户端只需换 base URL 即可迁移
- 可信度:⭐⭐⭐⭐⭐(ggml-org 官方博客,llama.cpp 是开源推理的事实标准)
- 后续行动:建议更新"推理引擎 / llama.cpp"主题页;可写一篇"Decision Model vs Chat Model 工程差异"的对比笔记
3. NVIDIA Nemotron — IOI + IMO 双料金牌
- 来源:https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026
- 发布时间:2026-10-07
- 核心观点:
- Nemotron-3-Ultra-CC 在 IOI 2026 取得 535.4/600 分(满分 600,金牌线 361.12),超人类选手(498.27)
- Nemotron 3 Ultra 通用版在 IMO 2026 取得 30/42(官方金牌线 29)
- 可复用specialization recipe:强基座 + 领域数据 curation + SFT/RL + generate-verify-refine 推理循环
- IOI 2026 关键数据:Nano-CC 经过 SFT 后 280pts → RL 后 291pts → GenCorrect 后 468pts → 金牌线 438.3pts 跨越;Ultra-CC 单独 SFT 后 502pts → GenCorrect 后 535.4pts
- IMO:SFT checkpoint 首轮最强,RL checkpoint 全局最强,两者互补,最终系统融合两者
- 可信度:⭐⭐⭐⭐⭐(NVIDIA 官方博客 + 两篇 arXiv 论文支撑:2609.10712 / 2609.02849)
- 后续行动:建议写入"LLM Specialized Fine-tuning"主题页;关注 GenCorrect(generate-evaluate-refine)模式的工程复现可行性
🟠 高价值
4. LiquidAI Open-D1 — 边缘多模态 Decision Model
- 来源:https://huggingface.co/blog/LiquidAI/open-d1
- 发布时间:2026-10-07
- 核心观点:边缘场景的多模态决策模型,D1 系列新增视觉理解能力
- 可信度:⭐⭐⭐⭐(LiquidAI 是活跃的 AI 初创,有 HF 官方博客背书)
- 后续行动:关注边缘部署场景;与 llama.cpp Decision Models 一起可构建"本地决策/路由"技术栈
5. autotrust JEV-27B — 决策模型新成员
- 来源:https://huggingface.co/blog/autotrust/autotrustjev-27b-fast-calibrated-decisions-and-full-reasoning
- 发布时间:约 2026-09-27
- 核心观点:单一开放模型提供快速标定决策 + 完整推理过程;27B 参数,Apache 2.0 或 CC BY-NC 4.0
- 可信度:⭐⭐⭐⭐(HF 官方 Blog 推广)
- 后续行动:与 OpenJev、Kev-4B 共同补充"Decision Model"家族的技术对比表
🟡 中等价值
6. arXiv CLIMB — 多模态 RAG 置信度控制(arXiv 2610.03421, 2026-10-02)
- 来源:https://arxiv.org/abs/2610.03421
- 核心观点:多模态 RAG 中,LLM 对检索到的证据没有显式置信度感知。CLIMB 框架在推理时用 R/E/C critic(相关性 / 证据特异性 / 跨模态对齐)评分,只有置信度提升才接受更新答案,无需修改 retriever 或 MLLM。
- 可信度:⭐⭐⭐⭐(arXiv 新论文,有百科 VQA 和 InfoSeek 实验验证)
- 后续行动:可作为"多模态 RAG 评估"相关条目的技术引用
7. MM-ContextFold — 多模态 Agent 检索的上下文爆炸问题(arXiv 2609.23121, MM'26)
- 来源:https://arxiv.org/abs/2609.23121
- 核心观点:
- 多模态 Agentic Retrieval (MAR) 中,随工具调用增加,原始图片不断积累造成 context 爆炸
- 发现:当图片被提取为文本后,原始图片在上下文中变得冗余,甚至会降低准确率
- MM-ContextFold:主上下文维护纯文本(高阶规划),按需加载图片到临时分支上下文,用完即弃
- 结果:7 个 MAR benchmark 平均准确率 +6.3%,working context 长度 -27.5%
- 可信度:⭐⭐⭐⭐(ACM MM'26 会议论文,有完整代码开源)
- 后续行动:建议写入"Agent Context Management / 多模态 Agent"主题页;与 MemPilot(arXiv 2610.06830)联合归档
8. MemPilot — LLM Agent 按需多模态记忆管理(arXiv 2610.06830, 2026-10-05)
- 来源:https://searcharxiv.org/abs/2610.06830
- 核心观点:
- 现有 Agent 记忆系统在构建记忆时与查询无关,产生不必要预处理成本
- MemPilot:用 RL 优化多步 LLM policy,在"从记忆检索"和"按需整理原始多模态历史"之间迭代选择
- 同时控制证据数量、整理指令、模型选择、视觉访问
- 在 5 个 benchmark 上实现了更好的 performance-cost-latency trade-off
- 可信度:⭐⭐⭐⭐(arXiv 较新,有强化学习优化框架)
- 后续行动:与 MM-ContextFold 合并归档为"多模态 Agent 记忆"专题
9. GraMRAG — 图记忆增强多 Agent 多步推理(arXiv 2609.14066, 2026-09-12)
- 来源:https://arxiv.org/abs/2609.14066
- 核心观点:
- 现有 multi-agent RAG 在复杂多模态推理任务上受限于推理深度和记忆结构
- GraMRAG:动态多模态记忆图(DAG)+ vision-text bridged reasoning paradigm + TAPO(拓扑感知策略优化)
- DAG 显式建模 action-observation 依赖,抑制冗余检索
- TAPO 利用图拓扑做 credit assignment
- 可信度:⭐⭐⭐⭐(arXiv,有完整实验和 benchmark)
- 后续行动:可归档至"Multi-Agent RAG / 图增强 RAG"专题
10. Optio — 自托管 AI 工程平台
- 来源:https://github.com/jonwiggins/optio(⭐1033,MIT License)
- 核心观点:
- 自托管 Kubernetes AI coding agent 平台,可在企业基础设施运行 Claude Code / OpenAI Codex / GitHub Copilot / Gemini 等多 Agent
- Pod-per-repo 架构:每个仓库一个长生命周期 Pod,用 git worktree 实现隔离
- 支持三种任务:Tasks(Ticket→PR)、Jobs(独立 Agent 运行,无 git checkout)、Agents(长生命周期消息驱动服务)
- 支持 Notion/Slack/Linear/GitHub/PostgreSQL/Sentry 等 Connections,运行时注入 MCP servers
- 提供 Helm chart 安装,生产就绪:OIDC/OAuth、AES-256-GCM 静态加密、Kubernetes RBAC、审计友好的任务历史
- 可信度:⭐⭐⭐(活跃开源项目,2026-03 创立,文档完善)
- 后续行动:可归档至"AI Agent 工程平台 / Self-hosted Agent"专题;与 AutoGPT、Superpowers 等 Agent 框架并列
二、分类标签
agent-evaluation decision-model llama.cpp multimodal-RAG context-management nvidia-nemotron agent-memory multi-agent-RAG self-hosted-agent kubernetes inference-optimization
三、建议写入路径
/shared/research-kb/inbox/jay/2026-10-08-1735-jay-hf-blog-thinkingbox-decision-models-arxiv-oct08.md(本文)
四、是否需要精读/审稿/主题页更新
| 条目 | 动作 |
|---|---|
| ThinkingBox | ⭐ 建议精读 arXiv 原文 + OpenEnv 代码;更新"Agent 评估方法论"主题页 |
| llama.cpp Decision Models | 建议更新"推理引擎 / llama.cpp"主题页,补充 Decision Model 技术栈 |
| NVIDIA Nemotron | 建议写入"LLM Specialized Fine-tuning"主题页,补充 GenCorrect 模式 |
| LiquidAI Open-D1 | 关注项,边缘推理场景可跟进 |
| JEV-27B | 关注项,与其他 Decision Model 合并归档 |
| CLIMB | 可引用至"多模态 RAG"专题 |
| MM-ContextFold | ⭐ 建议与 MemPilot 合并归档至"多模态 Agent 记忆"主题页 |
| MemPilot | 同上 |
| GraMRAG | 建议归档至"Multi-Agent RAG / 图增强 RAG"专题 |
| Optio | 建议归档至"AI Agent 工程平台 / Self-hosted"专题 |
五、本次摘要统计
- 检索范围:GitHub API (stars排序) / HuggingFace Blog / arXiv (2026-09~10) / Exa Search
- 候选条目:15 条
- 高价值条目(⭐⭐⭐⭐+):9 条
- 涉及主题:Agent 评估新范式、本地推理决策模型、多模态 RAG、Agent 记忆管理、自托管 AI 工程平台、大模型 Specialized Fine-tuning