Stephen 总协调检查 · 2026-08-27 午间

检查时点:2026-08-27 12:45(Asia/Shanghai)
检查范围:/shared/research-kb/inbox/{stephen,tom,jay,flyp,spark}/ 当日可见草稿,以及当日 review/metadata/ 记录。
检查目标:核对 agent、rag、multimodal、systems、engineering、csdn 六类覆盖,进行去重、补漏、冲突与人工确认项标记。

一、覆盖结论

分类 当日覆盖 代表条目 协调判断
agent Agent Gym、SecOPD、AgentRoom、SkillGate、Agent 安全/并发/工作流约束 覆盖充分;需从“候选雷达”收敛为 1–2 篇全文精读
rag RAGSieve、PinSieve、RAG 架构演进、GraphRAG/OAG、检索安全与工程实践 覆盖充分;注意把“高覆盖”与“可复现/可核验”分开
multimodal GigaBrain-0.7、OraRL、LAION-BVD、Smart Glasses、WeMM-Embedding、EchoWM 当日最密集方向;存在时间、分类、架构实质和实验规模待核问题
systems PostgreSQL-V 2.0、OdinANN、C²KV、Ready Cohorts、vLLM、Kubernetes/Wasm/eBPF 覆盖充分;工程数字和“新版本”需优先回到原论文/官方文档核验
engineering Harbor、Azure AI Foundry 教程、browser-use、strands-agents、RAGSieve、SkillGate、C²KV 覆盖充分;CSDN 条目需严格检查是否真有环境、命令、源码或排障过程
csdn 中等 RAG 本地化、多模态对齐、Agent 框架、vLLM/SGLang 实测文章 今日新增较多,但批量文章仍存在“标题宏大、工程细节未证明”的收录风险;不应自动进入正式主题页

二、跨实例去重与可去重簇

  1. GigaBrain-0.7 / VLA 三系统架构 - Stephen:AI 行业主题中有具身与工业落地的邻接线索。 - Tom:08:40 雷达列为高价值 #1,另有 HF Daily 91▲。 - flyP:09:50 批判性精读,已给出 arXiv:2608.15875、提交日冲突、架构实质与复现风险。 - flyP multimodal E1 又做了同主题扩展。 - 协调结论:后续只保留 Stephen 的总协调索引;正式条目以 flyP 精读为底本,Tom 只保留候选雷达,不再重复成稿。

  2. SecOPD / prompt injection 防御 - Tom 雷达和 RAG/长上下文材料均有覆盖。 - Stephen AI-industry 与 agent 安全主题有邻接引用。 - 协调结论:按 agent-security 主题统一核验论文、实验与代码;不要与 Trustworthy RAG/RAGSieve 混为同一攻击面。

  3. PinSieve / selective VLM serving / governed memory flywheel - Tom 雷达、Tom RAG E1、flyP multimodal E1、Stephen AI-industry 均有记录。 - 协调结论:统一使用 arXiv:2608.24040;重点核验“2.05×过滤”基准、生产部署和“bounded/stateful/observable/governable”是否形式化。

  4. RAG 架构与工程 - Jay 五类简报、engineering E1、CSDN 高价值轮次、Tom RAG E1 均有大量条目。 - 协调结论:拆分“架构综述”和“可复现实践”两条线。CSDN 批量条目只作线索,不因包含代码字样就进入 reviews。

  5. C²KV / Lynx / MTP / EAGLE / 推理优化 - Jay 五类简报、Stephen AI-industry、engineering E1、Substack 记录交叉出现。 - 协调结论:Substack 只能提供线索;C²KV 的 17×、Lynx 的 30% TTFT 必须在原论文/代码条件下核验,不能直接作为稳定性能结论。

  6. EchoWM / WeMM-Embedding / LAION-BVD / Smart Glasses / OraRL - Tom 雷达、flyP multimodal E1、Spark 复盘、Stephen 主题简报交叉出现。 - 协调结论:统一保留为 multimodal 主题页候选;EchoWM 已沿用旧稿,新增内容不应重复写入。

三、候选条目(按主题归并)

A. Agent / RAG / 安全

  • GigaBrain-0.7arXiv:2608.15875):VLA、预测/理解/动作三系统、跨 16 embodiments;需全文核验架构、数据构成、公开 benchmark 与开源承诺。
  • SecOPDarXiv:2608.21500,以原论文为准):on-policy 蒸馏缓解 adaptive prompt injection;需核验 token 级定位、攻击基准和代码。
  • AgentRoom(HF Daily):多 Agent 并发编码与 CRDT 工作区;需核验冲突模型、扩展性和真实工作负载。
  • Automata from Agent Traces:将轨迹压缩为 FSM,用于审计/监控;需核验状态机完备性与噪声边界。
  • When “Must” Becomes “Maybe”:Agent 工作流约束弱化;需核验约束定义和失效场景。
  • RAGSievearXiv:2608.13010):语料入库+查询时双重投毒防护;需核验 67.4%→14.0% 的实验协议和 41.3% F1 的适用代价。
  • Trustworthy RAGarXiv:2608.21095v1,以论文/会议页面为准):RAG 安全性评估;需检查会议归属、指标和代码可用性。
  • SkillGatearXiv:2608.18852):策略内 skill selection;需核验 40.8%→53.2% 的比较条件与误导性候选定义。
  • Agent GymarXiv:2608.15591):Agent 规格/调查/运行时修正;需核验具体模块与代码仓库。

B. Multimodal / VLA

  • Annotations as Rollouts / OraRLarXiv:2608.20492):把 annotation 作为 oracle rollout;需核验其“on-policy”定义与合成/弱标注边界。
  • LAION-BVDarXiv:2608.24845):千万小时级开放视频数据;需核验数据来源、许可、caption 质量与实际可下载性。
  • Smart GlassesarXiv:2608.24877):第一人称智能平台综述/系统视角;需核验硬件指标、隐私和行动接口。
  • WeMM-EmbeddingarXiv:2608.24053):2B/4B/9B 统一多模态 embedding;需核验与 ColPali/ColQwen2 的检索质量和成本对照。
  • Game2WorldarXiv:2608.24680):从游戏视频提取 UI 资产并辅助世界模型训练;需核验跨域泛化。
  • Entropy-ValleyarXiv:2608.22274):扩散机器翻译的长度自适应解码;当前被分到 multimodal,但应谨慎标注为“multimodal-adjacent / method”而非核心多模态。
  • MoTEarXiv:2608.22120):视频理解 task experts;需核验专家路由是否真正稀疏、跨任务收益和代码。
  • Prism2 / 病理多模态基础模型:来自 Substack 线索;需回到论文/机构公告核验,不直接录入。

C. Systems / Engineering / Database

  • PostgreSQL-V 2.0arXiv:2608.15994):集成式向量数据库;需核验代码、对比对象和系统规模。
  • OdinANN(FAST ’26):十亿级图向量直接插入;需补齐正式论文和代码链接。
  • To GPU or Not to GPUarXiv:2605.15957):关系引擎中 GPU 向量检索与 PCIe 瓶颈;需核验代码和硬件测试条件。
  • C²KVarXiv:2608.14192):非前缀 KV 复用和推理加速;17× 需实验条件限定。
  • Ready CohortsarXiv:2608.12123):GPU Agent 控制边界形式化;需核验在线开销与实际部署条件。
  • browser-use:活跃 GitHub 项目,但不能仅凭 star 称为生产级;缺公开 SLA、企业案例与安全审计。
  • Harbor Framework:标准 Agent 评估容器与 benchmark 支持;适合进入 engineering/agent-evaluation 主题页,需精读 README/examples 和 release 状态。
  • strands-agents / harness-sdk:工程控制平面与安全 shell;需核验许可证、版本稳定性、生产使用证据。
  • eBPF + Serverless Wasm observability:原型和性能实验线索较强;需补论文全文、代码、部署环境。
  • bpftime:OSDI 2026 / GitHub 线索;建议作为可复现工程条目,但需核验当前会议论文和代码版本。
  • vLLM v0.20.2、SGLang、PagedAttention、FP8 等:需以官方 release/docs 为准,不以博客 benchmark 直接作定论。
  • pgvector consolidating / 30+ 企业客户 / QPS 对比:属于工程博客聚合,数字必须逐项核验。
  • browser-use / strands-agents / AgentEval:均需将“活跃 GitHub”与“生产就绪”分开评级。

D. CSDN 高价值候选

本轮 CSDN 轮次提供了 4 个方向的候选,但只有满足以下任一条件才建议进入主题页:明确依赖/版本、命令、完整配置、源码分析、benchmark 条件、真实报错/排障、复现结果。

  • RAG:Ollama + Chroma 本地 RAG(含分块/向量检索/Prompt 命令)可列为优先精读;其余“四代架构/五条路线”适合做索引,不应直接当技术事实来源。
  • Agent:LangGraph/AutoGen/CrewAI/ADK 横向比较和低成本企业 Agent 四层架构可作为选型线索;需检查是否原创、有无运行命令和真实限制。
  • Multimodal:Dify 多模态集成、跨模态对齐避坑可精读;含“90%团队忽略”等标题化数字的条目需回原文核验。
  • Inference:vLLM/SGLang/TensorRT-LLM 选型文,以及带 TTFT/TPOT/P99、显存占用的实测文优先;无硬件/模型/并发/精度条件的 benchmark 只能做低可信参考。
  • MLOps:微调框架横评仅作索引;xxx 占位或无真实 URL 的候选不得进入正式库。

四、Substack 搜索规则核对

本轮协调已检查可见 Substack 线索,并将以下内容保留为“研究线索”而非高可信最终事实:

  • Mind & Machine Weeklyhttps://mindandmachineweekly.substack.com/p/weekly-ai-newsletter-27-july-to-2,2026-07-31 前后。摘要涉及 Prism2、C²KV、Lynx;核心价值在于发现原论文线索。可信度中等,C²KV 的 17× 与 Lynx 的 30% TTFT 需核验原论文/实验条件。
  • Ken Huang / The Physics & Engineering of Frontier LLM Inferencehttps://kenhuangus.substack.com/p/announcing-the-10-part-series-the,2026 年系列预告,核心看 DeepSeek MTP、EAGLE、Memory Wall、TCO;计划 2026-09-04 起连载,当前可信度中等,系列尚未完成,不应把预告当已验证结果。
  • Aishwarya Srinivasan / Harness Engineeringhttps://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness,2026 年;强调 harness 与 model 区分、Forward Deployed Engineer 能力。工程视角有价值,但“仅 5% enterprise agents reach production”需核验原始统计来源。
  • Interconnects(Nathan Lambert)https://www.interconnects.ai/p/lessons-from-the-hackshttps://www.interconnects.ai/p/5-useful-things-youll-learn-in-my,作为工程与后训练研究线索;目前应做主题索引/订阅跟踪,不复制长段。
  • World Labs / Fei-Fe Li 相关 Substack 线索:flyP GigaBrain 精读提到空间智能关联,但未提供本轮可直接核验的原始文章链接/发布时间,不纳入正式条目,避免把主题联想误写为 Substack 事实。

Substack 协调结论:本日已有 Substack 覆盖记录,但 Stephen 不另造重复 Substack 草稿;后续搜索必须记录作者/专栏、原文链接、发布时间、核心观点、可信度、是否需核验。当前需要补核的是 Mind & Machine Weekly 的 C²KV/Lynx、Ken Huang 预告、EAGLE/MTP,以及 Aishwarya 的 5% 统计。

五、缺口、冲突与人工确认

缺口

  1. RAG 需要更强的一手评估与复现证据:当前大量架构综述和 CSDN 线索,缺少统一数据集、检索器、生成器、延迟/成本、攻击基线条件。
  2. Agent 缺少长时可靠性与故障恢复的系统对比:SecOPD、AgentRoom、Automata、约束弱化等方向互补,但尚未形成统一 benchmark。
  3. Systems 需从“框架清单”转向“同条件 benchmark”:C²KV、vLLM、bpftime、browser-use、Harbor 的硬件/工作负载差异很大,不能横向直接排名。
  4. CSDN 的多模态与 RAG 方向候选过密、证据不足:需要审稿级去伪存真,不宜批量进入正式主题页。
  5. Substack 直接核验记录不完整:本日虽满足纳入候选来源规则,但缺统一的 Substack 元数据表(作者、日期、链接、观点、可信度、行动)。

冲突 / 风险

  • GigaBrain-0.7 提交日期:Tom/HF 雷达写 8 月 15 日,arXiv 记录写 2026-08-16;以 arXiv 页面为准,后续统一写 8 月 16 日。
  • GigaBrain-0.7 架构命名:三系统是共享 backbone/head、模块化组件还是端到端独立系统尚未证实;不可直接称“三模型”。
  • OdinANN 来源:目前先经 GitHub awesome-vector-database 索引,缺正式 FAST 论文 URL/代码。
  • C²KV 17×、Lynx 30% TTFT:来自 Substack/二手摘要;必须回到原论文并限定实验条件。
  • GigaBrain 数据:37,000+ 小时与 270M V-L 样本的真实性、真实/合成比例和 loss 配比待核。
  • RAGSieve 指标:67.4%→14.0% 是攻击成功率下降,41.3% 是未投毒 F1,不能将 14% 直接解释为系统足够安全。
  • Entropy-Valley 分类:当前被列为 multimodal 主分类,但其主题是 masked diffusion machine translation;建议改为 multimodal-adjacent/method,避免主题页误归类。
  • OraRL 的 on-policy 定义:annotation 作为 oracle rollout 与传统 on-policy 采样定义可能存在张力,需要论文术语核验。
  • Stephen AI-industry 中 Sarah Friar “CEO”修订风险:需独立核验其当前 OpenAI 官方身份;不能把“CFO→CEO”简单二选一。
  • BASM 的 EMNLP 2026 Findings “已接收”:暂未找到独立接收证据,建议降为“投稿/审稿中/待确认”,除非后续补齐官方记录。
  • Jalapeño 芯片归属:应写成 OpenAI 设计、Broadcom/合作量产等准确关系,不直接称 OpenAI 独立自研推理芯片。
  • pgvector 30+ 企业部署及 QPS 数字:工程博客统计可能存在口径、样本和硬件条件不一致。

六、协调决策

  1. 今日六类分类均有覆盖,不要求各实例重复补搜。
  2. Stephen 本轮不新增内容草稿:现有草稿已覆盖 AI industry、新闻雷达和 HF 动态;继续新增会重复 Tom/flyP/Jay 的主题条目。
  3. 后续发布前按主题合并: - agent-security:SecOPD、Trustworthy RAG、RAGSieve、SkillGate、Agent Gym; - rag:PinSieve、RAGSieve、RAG 架构/工程实践; - multimodal:GigaBrain、OraRL、LAION-BVD、Smart Glasses、WeMM-Embedding、EchoWM; - systems-engineering:C²KV、Ready Cohorts、Harbor、browser-use、bpftime、PostgreSQL-V/OdinANN。
  4. CSDN 采用“一篇一审”原则:只有出现版本/环境/命令/源码/复现/排障证据才升格;纯趋势、框架大全和标题化数字降为线索。
  5. Substack 继续只作线索:每个条目补齐六要素,且所有量化主张进入“待核验”状态。
  6. 不执行任何 GitHub 写入操作

七、建议写入路径

本次实际写入:

  • /shared/research-kb/inbox/stephen/2026-08-27-1245-stephen-coordination-check-noon.md

建议后续由独立同步任务处理的 GitHub-ready 目标结构(本次未写入、未提交):

  • notes/agent-security/:SecOPD、Trustworthy RAG、RAGSieve、SkillGate、Agent Gym
  • notes/rag/:PinSieve、RAGSieve、RAG 架构/工程实践
  • notes/multimodal/:GigaBrain-0.7、OraRL、LAION-BVD、Smart Glasses、WeMM-Embedding
  • notes/systems-engineering/:C²KV、Ready Cohorts、Harbor、browser-use、bpftime、PostgreSQL-V、OdinANN
  • topics/csdn-highvalue/:仅收录通过审稿和复现条件检查的 CSDN 条目
  • topics/substack-radar/:Substack 线索与核验状态元数据,不放原文长摘录

八、精读 / 审稿 / 主题页更新结论

  • 需要精读:GigaBrain-0.7、SecOPD、AgentRoom、Automata、OraRL、LAION-BVD、C²KV、RAGSieve、SkillGate、PostgreSQL-V 2.0、OdinANN、Harbor、bpftime。
  • 需要审稿/人工确认:所有 Substack 量化主张;CSDN 中含“90%团队忽略”“5% production”等统计的条目;GigaBrain 日期/架构/数据构成;Sarah Friar 身份;BASM 接收状态;Jalapeño 归属。
  • 需要主题页更新
  • 是:multimodal、agent-security、RAG-security、agent-evaluation、LLM inference/engineering、Substack 雷达。
  • 条件更新:ai-industry 仅在官方身份、接收状态和 Substack 原论文核验完成后更新。
  • 暂不更新:把 Entropy-Valley 继续作为 multimodal 主分类;未通过证据门槛的 CSDN 文章。