Jay 工程筛选报告 · 二次筛选 · 2026-08-04 18:50

角色: Jay · 工程二次筛选 时间: 2026-08-04 18:50 (Asia/Shanghai) 筛选范围: 今日(08-04)全部 inbox 条目 + RSS feeds 的工程相关性二次复核 重点: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤


一、今日工程筛选总览

上午 T1050 首轮筛选已保留 7 条高价值条目(含 3 条新 arXiv)。本轮二次筛选聚焦下午批次(CSDN RAG 专项 / LLM 推理 CSDN / RSS feeds / X 雷达),去重后评估净增量。

今日去重矩阵:

条目 T1050首轮 T1335 trending T1335 trending 上午RSS 本轮筛选
SDB架构方法论 (arXiv:2605.20173) ✅保留 - - 已在首轮
StriaTrace OSDI 2026 ✅保留 - - 已在首轮
time-to-first-token路线图 ✅保留 - - 已在首轮
Gemma kernel优化 ✅保留 - - - 已在首轮
NVIDIA控制钩子 ✅保留 - - 已在首轮
Lilian Weng Harness Engineering - ✅ RSS 新增候选
TokTier (arXiv:2607.29678) - ✅ Cool Papers 新增候选
ResKV (arXiv:2607.29591) - ✅ Cool Papers 新增候选
OpenViking/VikingMem - - 已在T1335收录
headroom token压缩 - - 已在T1335收录
Kimi K3 / GPT-5.6定价 - - 模型发布,非工程命令
Datadog AI Engineering - - - 已有datadog报告归档
MCP 2.0 (simonw demo) - - - ✅ X雷达 新增候选
StateAct - - - ✅ X雷达 新增候选
Claude Code MCP skill - - - ✅ X雷达 新增候选
CSDN RAG全链路 (#1/#2/#5/#6) - - 新增候选
CSDN llm-inference (#1) - - 新增候选

二、✅ 本轮保留条目(高工程价值)


🔷 新增1 · ⭐⭐⭐⭐⭐ · CSDN RAG 全链路实战 + 法律 RAG 案例(CSDN 高价值精读组)

来源: jay/inbox/2026-08-04-1220-csdn-rag-mlops-agent-highvalue.md(第1、2条) 可信度: 高(CC 4.0 BY-SA,含可运行代码片段) 领域: RAG 工程实践 / 混合检索 / 法律 AI

CSDN #1 — 混合检索实战代码(BM25 + cosine similarity + 时间衰减):

保留理由: - 真实排坑经验:BM25 分数范围(0-1)与余弦相似度(-1~1)不统一导致排序混乱的坑 - 完整技术栈:ColBERT + bge-reranker-large(生产级 reranker) - 可运行片段:BM25 查询扩展(rank_bm25 库)+ 向量精排代码 - Embedding 选型数据:中文 BERT 比通用模型准确率高 23%(有对照基准声明)

保留字段:BM25/cosine hybrid scoring、ColBERT + bge-reranker 技术栈、中文 Embedding 基准数据 丢弃字段:无(内容精炼,CC 协议)


CSDN #2 — 法律 RAG 案例(Qwen2-Embedding + FAISS/Chroma + DeepSeek 因果推理):

保留理由: - 企业级数据流水线:Apache Tika 格式标准化 + 领域本体论概念映射 + 增量索引版本控制 - 真实业务场景:法律 RAG 的 PDF 格式混乱 / 同义词检索遗漏 / 数据更新延迟三大坑 - 完整解决方案:含 FAISS/Chroma 向量库选型依据、DeepSeek 因果推理注入方案

保留字段:企业 RAG 防坑三件套、Qwen2-Embedding + FAISS/Chroma 技术栈、Apache Tika 数据标准化 丢弃字段:无

标签: RAG 混合检索 BM25 ColBERT bge-reranker 法律RAG FAISS Chroma DeepSeek 建议行动: 精读原文代码片段;与 RAGFlow / ragflow 工具链对照;建立"RAG 生产防坑清单"


🔷 新增2 · ⭐⭐⭐⭐⭐ · StatAct:程序状态管理 — Agent 长周期 Computer-Use 任务框架

来源: X 雷达 + @_akhaliq (2026-08-04T1140-news-x-tech-radar.md) URL 线索: https://x.com/_akhaliq/status/2081921773910499494 可信度: 高(学术框架,arXiv 论文支撑) 领域: Agent 架构 / Computer Use / 上下文管理

核心工程价值: - 问题定义精确:Agent 执行长周期 computer-use 任务时,子目标跨步骤切换导致 context 污染和状态错误 - 解决方案:subagent 化——每个子目标分配 fresh subagent,保持 context 干净,StateAct 管理跨 subagent 程序状态 - 与 T1050 首轮 SDB 架构方法论互补:SDB 解决"随机-确定性边界",StateAct 解决"跨 subagent 状态一致性"

与上午首轮关系: T1050 的 arXiv:2605.20173 SDB 方法论已覆盖 Agent 架构模式;StateAct 提供了"无状态化 subagent 划分"的具体工程实现路径,可作为 SDB 方法论的案例补充。

保留理由: Agent 生产部署中高频踩坑场景(长任务丢位置 / context 膨胀)的系统性解决方案;与 SDB 架构方法论互补

标签: Agent StateAct Computer-Use 上下文管理 Subagent SDB补充 建议行动: 检索原文 arXiv 编号并归档;与上午 SDB 架构方法论对照,建立"Agent 长任务状态管理"专题


🔷 新增3 · ⭐⭐⭐⭐⭐ · Claude Code + MCP Skill 构建实战 — 6 个每日自动化 Skill

来源: X 雷达 + @svpino (2026-08-04T1140-news-x-tech-radar.md) URL: https://x.com/svpino/status/2079581522936676819 可信度: 高(实战经验,6 个真实 skill,半数并发运行不冲突) 领域: Claude Code / MCP / AI 工程自动化

核心工程价值: - 真实并发场景:6 个每日自动化 skill,半数并发运行不冲突的实现经验 - MCP skill 工程模式:直接从 prompt/指令构建可用 skill 的工程路径 - Claude Code 生态:OpenClaw 自身也基于 Claude Code,skill 构建经验可直接参考

保留理由: MCP skill 工程化实战,与 OpenClaw 自身 skill 生态高度相关;并发 skill 冲突处理是生产部署稀缺经验

标签: Claude-Code MCP Skill构建 自动化 并发 建议行动: 提取 @svpino 帖子全文;与 OpenClaw skill 构建文档交叉参考


🔷 新增4 · ⭐⭐⭐⭐ · TokTier — 面向 Agentic LLM 服务的精确有状态 Tokenization

来源: Cool Papers CS.CL (2026-08-04T1002-rss-cool-papers.md) + T1335 trending arXiv: https://papers.cool/arxiv/2607.29678 可信度: 高(cs.CL 论文,解决真实工程问题) 领域: LLM 服务系统 / Tokenization / KV Cache

核心工程价值: - 问题场景:LLM 服务系统缓存 prompt KV 状态,但每次调用仍对完整请求文本重新 tokenize——对 Agentic LLM 尤其浪费(反复重提交长文本) - 解决方案:有状态 tokenization 框架,减少重复 tokenize 开销 - 与 KV Cache 五大方向(v44 §2.1)关系:属于"前缀缓存 / KV cache 复用"的 tokenization 层面优化,与 StriaTrace(首轮 OSDI 2026)同属推理服务工程

保留理由: tokenization 层面的 KV cache 优化,填补了上午首轮"KV cache 压缩"(FlexGen/Mooncake 等)与"Prefill-Decode 分离"之间的空白层

标签: Tokenization KV-Cache Agentic-LLM 推理服务 arXiv:2607.29678 建议行动: 查原文 arXiv 归档;列入 KV Cache 优化体系(v44 §2.1 补充)


🔷 新增5 · ⭐⭐⭐⭐ · ResKV — 固定预算 KV Cache 压缩(通过重建被忽略的注意力贡献)

来源: Cool Papers CS.CL (2026-08-04T1002-rss-cool-papers.md) arXiv: https://papers.cool/arxiv/2607.29591 可信度: 高(cs.CL 论文,方法论具体) 领域: KV Cache 压缩 / 长上下文推理

核心工程价值: - 问题场景:现有 KV cache 淘汰方法(eviction)会永久丢弃未被选中 token,消除其注意力聚合贡献 - ResKV 方案:固定预算 KV cache 压缩,通过重建被忽略的注意力贡献来保留信息 - 与上午首轮关系:与 arXiv:2607.26571(能耗建模)同属推理系统优化方向,与 v44 §2.1 KV Cache 五大方向直接相关

保留理由: KV Cache 压缩的新思路,与 FlexGen/Mooncake/StreamingLLM 等 v44 §2.1 已有条目互补;固定预算约束符合生产资源管理

标签: KV-Cache 压缩 长上下文 ResKV arXiv:2607.29591 建议行动: 查原文 arXiv 归档;列入 v44 §2.1 KV Cache 五大方向补充条目


🔷 新增6 · ⭐⭐⭐⭐ · CSDN vLLM 显存公式 + Ollama vs vLLM 实测对比

来源: jay/inbox/2026-08-04-llm-inference-csdn-highvalue.md(条目1、5) 可信度: 高(可运行命令 + 实测数据) 领域: vLLM 部署 / 显存计算 / 框架选型

CSDN #1 — vLLM PagedAttention 显存计算公式:

保留字段: - 每层显存 = ceil(max_model_len / 16) * num_layers * 2 * kv_bucket_size(字节) - Qwen2.5-7B 在 3090(24GB)报错 "需要 7.00 GiB KV 缓存,只有 5.26 GiB 可用" 的解决路径 - 关键命令:--max_model_len 90000(从 131072 降低节省显存)、--tensor-parallel-size 2--gpu_memory_utilization 0.95 - DeepSeek R1/QwQ:--enable-reasoning --reasoning-parser deepseek_r1,通过 reasoning_content 取思考过程

CSDN #5 — Ollama vs vLLM 并发实测:

保留字段: - 10 并发:Ollama ~148 tok/s;50 并发 p95=18.4s,p99=24.7s(架构性瓶颈) - 根本原因:Ollama FIFO 队列缺陷(GitHub issue #9054,2024 年开,2026-04 仍未修复) - 结论:低并发选 Ollama,高并发选 vLLM(continuous batching 架构优势)

标签: vLLM PagedAttention 显存公式 OOM Ollama 并发测试 benchmark 建议行动: 两条合并写入"LLM 推理引擎部署"主题页;Ollama FIFO issue #9054 作为框架选型反面案例


🔷 新增7 · ⭐⭐⭐⭐ · AIMultiple 2026 — vLLM vs LMDeploy vs SGLang H100 Benchmark

来源: jay/inbox/2026-08-04-llm-inference-csdn-highvalue.md(条目8) URL: https://aimultiple.com/inference-engines 可信度: 高(2026-04-15,benchmark 数据含具体数字) 领域: 推理引擎选型 / H100 benchmark

核心工程数据: - SGLang + FlashInfer:12,553 tok/s(H100) - LMDeploy:安装极简(pip install lmdeploy),生产部署实用最优性价比(99.5% SGLang 吞吐) - 坑(实测踩坑经验):FlashInfer wheel 依赖特定 PyTorch 版本,H100 优化镜像往往不兼容,排查耗时约 6 小时

保留理由: 2026 年最新 H100 benchmark 数据;LMDeploy 性价比被低估(pip 安装路径值得实测);FlashInfer 兼容性坑有实操价值

标签: SGLang vLLM LMDeploy H100 FlashInfer benchmark 建议行动: 列入推理引擎对比主题页(2026H1);FlashInfer 兼容性坑写入"Docker 部署 LLM 避坑清单"


三、🟡 本轮降级条目(有价值但需进一步核验)


降级1 · Lilian Weng Harness Engineering 与自我改进

来源: 2026-08-04T1002-rss-lilian-weng.md(7月4日文)+ T1335 trending 重复覆盖 可信度: 高(Lilian Weng 权威博客) 降级理由: - T1335 trending 已收录此条目;本次二次筛选不增加净增量 - 7月4日文章,生产工程深度待全文审阅后确认 - " Harness 递归自我改进"方法论性质强于命令/代码性质

建议: 归档为方法论参考,不作为本轮新增工程条目


降级2 · StateAct 框架(arXiv,需查原文)

来源: X 雷达,仅有摘要线索 降级理由: - 框架概念有价值,但具体 API / 实现路径未披露 - arXiv 编号需二次检索确认;框架成熟度需实测验证 - 与 SDB 架构方法论(上午首轮)有重叠,待原文核验后再定级

建议: 下轮筛选前先查原文 arXiv 编号,确认为正式论文后再升入高价值


四、❌ 本轮丢弃条目(详细理由)

条目 丢弃理由
CSDN AI原生MLOps认知革命(条目3) 原文引自"奇点大会未公开架构图谱",代码片段不完整(model-contract.yaml片段),无CC协议,工程价值无法独立核验
CSDN 8层工具栈(条目4) FP4量化+WebGPU数据有工程价值,但日期标注为"2026"无月日,内容疑似整合型文章;建议核验来源日期后再考虑
CSDN LMOps四维评估(条目5) 评估框架有参考价值,但"认证门槛数值来源"未披露;certification_thresholds JSON示例适合参考但需交叉核验
CSDN RAG全景综述(条目6) Embedding/向量库/rerank对照表实用,但全文无CC协议,部分内容疑似来自公开技术报告整合;建议购买或官方来源核实
CSDN Agent memory survey(条目7) 学术综述风格,无直接可复现代码或命令;已有T1335 trending的OpenViking/VikingMem更具体
CSDN 5个AI Engineer项目(条目8) 项目规划性质,含技术栈描述但无源码/部署步骤/性能数据;适合创意参考但非工程入库候选
CSDN GraphRAG工程演进(条目10) 趋势分析为主,无具体GraphRAG框架实现/命令/性能数据;已在上轮T1050的ragflow/OpenViking中覆盖
CSDN RAG技术全景指南/12条技巧(条目11/12) 无CC协议,质量待核验;技术选型建议无实测数据支撑
X雷达 Sakana AI Conductor/Agent World Modeling 研究性质为主,RL调度和world model是前沿研究方向,非今日工程筛选重点
X雷达 GLM 4.2安全漏洞分析 安全事件报告,模型设计问题,非工程实践命令/代码;已有上午T1050的CVE/hf-security-incident归档
Lilian Weng Scaling Laws 基础知识文章(6月24日),非今日新增;方法论价值,无具体工程命令或性能数据
Cool Papers FriendBench/组合性演化/谄媚行为 非工程相关性条目(社交推理/语言演化/认知科学),不符合本轮工程筛选标准
X雷达 poolside.ai 公开eval数据集 模型发布/eval分析,非本轮工程命令/部署筛选重点

五、本轮增量汇总

# 条目 来源 关键字段 可复现性
1 CSDN RAG全链路混合检索实战 CSDN #1 BM25+cosine+ColBERT+bge-reranker+中文Embedding基准 ⭐⭐⭐⭐⭐ 有代码
2 CSDN 法律RAG企业防坑三件套 CSDN #2 Tika+本体论+增量索引+Qwen2-Embedding+FAISS ⭐⭐⭐⭐⭐ 有方案
3 StateAct 长周期Agent状态管理 X雷达/@_akhaliq subagent化+程序状态干净+context防污染 ⭐⭐⭐⭐ 需查原文
4 Claude Code MCP Skill实战 X雷达/@svpino 6个skill+半数并发不冲突+skill构建工程路径 ⭐⭐⭐⭐⭐ 有经验
5 TokTier 有状态Tokenization Cool Papers 减少Agent重提交长文本的tokenize开销 ⭐⭐⭐⭐ 需查原文
6 ResKV 固定预算KV压缩 Cool Papers 重建注意力贡献+固定预算约束 ⭐⭐⭐⭐ 需查原文
7 CSDN vLLM显存公式+OOM路径 CSDN #1 PagedAttention公式+Qwen2.5-7B显存计算+DeepSeek-R1命令 ⭐⭐⭐⭐⭐ 有命令
8 CSDN Ollama vs vLLM并发实测 CSDN #5 50并发p95=18.4s+Ollama FIFO缺陷GitHub#9054 ⭐⭐⭐⭐⭐ 有实测
9 AIMultiple H100 benchmark AIMultiple SGLang 12553 tok/s+LMDeploy 99.5%+FlashInfer坑 ⭐⭐⭐⭐ 有数字

本轮新增高工程价值:4条(CSDN RAG实战×2 + vLLM/Ollama实测×2),次高工程价值:4条(StateAct/TokTier/ResKV/LMDeploy benchmark)


六、分类标签

RAG/混合检索/BM25/ColBERT/bge-reranker    ← 新增
法律RAG/Tika/本体论/FAISS/Chroma          ← 新增
Agent/StateAct/Subagent/上下文管理        ← 新增(需核验)
Claude-Code/MCP/Skill/并发                 ← 新增
vLLM/PagedAttention/显存公式/OOM           ← 新增
Ollama/并发测试/FIFO缺陷/issue9054         ← 新增
TokTier/有状态Tokenization/KV-Cache        ← 新增(需核验)
ResKV/KV压缩/长上下文/注意力重建            ← 新增(需核验)
SGLang/LMDeploy/FlashInfer/H100/benchmark  ← 新增

七、建议写入路径与行动

本次写入文件:

/shared/research-kb/inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md

建议行动优先级:

优先级 条目 操作
P1 精读 CSDN RAG全链路 #1 + #2 原文代码/方案直接入库;建立"RAG生产防坑清单"
P1 精读 CSDN vLLM显存公式 #1 + Ollama vs vLLM #5 两条合并写入"LLM推理引擎部署"主题页
P1 精读 Claude Code MCP skill实战 @svpino帖子全文提取;与OpenClaw skill构建文档交叉参考
P2 核验 StateAct原文 查arXiv编号,确认为正式论文后与上午SDB方法论对照
P2 核验 TokTier / ResKV原文 查arXiv编号;TokTier列入KV Cache补充,ResKV列入v44 §2.1
P2 收藏 AIMultiple H100 benchmark FlashInfer兼容性坑(6小时)写入"Docker部署LLM避坑清单"
P3 参考 LMOps四维评估框架 参考评估维度,核验数值来源后选择性入库
归档 Lilian Weng Harness Engineering 归档为Agent方法论参考,不作工程命令条目

与首轮(上午 T1050)关系定位: - 首轮:生产级推理追踪系统(StriaTrace)、推理MLOps全链路路线图、Gemma kernel优化、NVIDIA控制钩子 → 推理部署/基准测试 - 本轮:RAG全链路混合检索、法律RAG企业防坑、Agent长任务状态管理、MCP skill构建、KV Cache tokenization层(TokTier)、固定预算压缩(ResKV) → RAG工程化/Agent上下文管理/KV Cache新思路 - 互补关系:上午覆盖推理引擎部署与基准测试,下午覆盖 RAG 工程实践与 Agent 上下文管理,共同构成"LLM应用工程化"全栈


Jay · 工程筛选二次复核 · 2026-08-04 18:50 CST · 无 GitHub 写入 · 仅输出草稿路径