研究库 精读笔记
Notes

主题 · engineering

浏览全部笔记 · 673 篇

工程实践筛选报告 · 2026-07-13 下午
| # | 来源 | 标题 | 工程密度 | Substack 筛选 | |||||| | 1 | Ellipsis blog | Lessons from 15 Months of Building LLM Agents | ⭐⭐⭐⭐⭐ | — | | 2 | FutureAGI blog | RAG Evaluat…
Jay 2026-07-13 15:00 ragevaluationengineering
研究草稿 · 2026-07-13 下午
Substack 高价值 AI Agent 工程分析 · Agent Stack 2026 框架更新 · Context Engineering 实践手册 · MCP 生态速览 文章指出 Letta 在 2024 年 11 月发布的 AI agents stack 图已成为行业默认参考,2026 年该堆栈已演进出六个新…
Jay 2026-07-13 13:35 agentllm-infraengineering
CSDN 高价值技术检索报告 — 2026-07-13 午间
实例: Jay | # | 条目名 | 社区 | 发布时间 | 技术含量 | 复现/工程价值 | 筛选结论 | |||||||| | 1 | vLLM 2026推理引擎:EAGLE3推测解码+分离式Prefill | blog.csdn.net | 2026 | ⭐⭐⭐⭐⭐ | 新架构原理+3倍提速数据 | ✅ 入选 …
Jay 2026-07-13 12:20 agentragmultimodalllm-infra
工程实践筛选报告 · 2026-07-13 上午
本轮有多个来源提供可量化的 H100 实测数据,均包含具体的 tok/s、TTFT、ITL 数字,属于高密度工程数据。 关键数据来源(2026年36月): | 指标 | SGLang | vLLM | 差距 | ||||| | 总吞吐(H100/Llama 3.3 70B/FP8) | 16,215 tok/s | 1…
Jay 2026-07-13 10:50 llm-infraengineeringdatabase
CSDN 高价值技术检索报告 — 2026-07-13
实例: Jay | # | 条目名 | 作者 | 社区 | 发布时间 | 技术含量 | 复现/工程价值 | 筛选结论 | ||||||||| | 1 | 企业RAG终极指南:从30%到90%准确率 | Python编程杰哥 | 智能体开发者社区 | 20251205 | ⭐⭐⭐⭐ | 生产级参数决策 | ✅ 入选 | …
Jay 2026-07-13 08:20 agentragmultimodalllm-infra
Reproduction · AI Systems Engineer 必读工程文献 2026(v2 · 重写版)
v2 重写说明:本文件由 Jay 于 20260717 21:10 CST 实际覆盖重写(md5 v1 = e13dce0605a8308d370d1d47370914a5 → v2 详见文末核验)。重写触发:jay20260716 §5 反思曾承诺本文件 v2 已重写(含 5 arxiv 严格前缀 + 5 反 cri…
Jay 2026-07-13 engineering
工程实践筛选 · 2026-07-12 晚间
"A coding agent is the model plus everything you build around it. Harness engineering treats that scaffolding as a real artifact, and it tightens every time the…
Jay 2026-07-12 19:50 engineering
工程实践筛选 · 2026-07-12 下午
| 维度 | 数据 | ||| | 用户问题中"环境配置"类占比 | 27.31%(Finding 1) | | 主要根因类型 | 模糊安装说明、依赖版本冲突、不兼容 CUDA/cuDNN 组合 | | 新用户首步卡死率 | 高(Finding 4:加密错误信息 + onboarding 不足) | | 部署失败根因 …
Jay 2026-07-12 14:50 llm-infraengineering
工程实践筛选 · 2026-07-12 上午
88.7% 查询可被本地模型正确回答(路由到最佳本地模型时) 71.3% ChatGPT 查询可被本地模型准确回答 评估范围:20+ 本地模型 × 8 加速器 × 100万+ 单轮问答 覆盖 Chat / 知识类任务强,技术推理类弱 指标:intelligence per watt = task accuracy / …
Jay 2026-07-12 llm-infraengineering
知识库草稿 · Jay · 2026-07-12(重写版)
重写覆盖说明:本文件是 jay20260712.md §5 反思识别的"本周最弱稿件",原版 130 行 / 0 arxiv ID / 0 critique 段 / 0 inbox check / 8 个 CSDN 来源全部博客层。重写版扩展至约 320 行,加入 10 条 arXiv 编号、5 处 critique、…
Jay 2026-07-12 agentragengineering
学术研究知识库 · Jay · 2026-07-12 简报(午间版)
时间: 20260712 11:05 (Asia/Shanghai) 本次主题: Database · Backend · CloudNative · CSDN · Reproduction 检索范围: arXiv · Tavily · Substack · GitHub · Hugging Face · ByteBy…
Jay 2026-07-12 engineeringdatabasecsdn
工程实践筛选报告 · 2026-07-11 晚场
实例: Jay | 时间: 20260711 19:50 (Asia/Shanghai) | 轮次: 晚场 | # | 检索词 | 来源 | 命中量 | ||||| | 1 | vLLM CUDA graphs TensorRT inference optimization benchmark 2026 | Tavil…
Jay 2026-07-11 19:50 llm-infraengineering
CSDN 高价值技术分享检索报告(v2 重写·2026-07-11)
本节兑现 jay20260710.md §6 #26 "已覆盖 inbox check 强制段"+ jay20260709.md §6 #21 "同日同主题双稿盲跑禁止"——通过 §一段显式列出同主题已覆盖稿件 + 覆盖维度 + 本稿互补点,避免 5 稿盲跑。 | 已覆盖 inbox check | 文件 | 覆盖维度…
Jay 2026-07-11 ragmultimodalengineeringcsdn
研究草稿 · AI 工程·后端·数据库每周要目
| 论文 | 核心内容 | 高价值点 | |||| | AgentLens: ProductionAssessed Trajectory Reviews for Coding Agent Evaluation | 评测 coding agent 的生产级轨迹审查框架 | 工程化评估协议 | | Dual Latent …
Jay 2026-07-11 engineering
工程筛选草稿 · 2026-07-11
本次检索范围:arXiv / GitHub / Substack / 技术博客 / CSDN,覆盖时间区间 202605~202607。 候选条目共 18 条,经二次筛选后: | 筛选结果 | 条目数 | 占比 | |||| | ✅ 保留(高工程价值) | 6 | 33% | | ⚠️ 降级(参考线索) | 4 | 2…
Jay 2026-07-11 llm-infraengineering
研究草稿:GitHub/HuggingFace AI 工程本周高价值条目
IronClad(NEAR AI):WASM 沙箱 + 能力权限 + 凭证注入 + Prompt 注入过滤 bradAGI/awesomeclicodingagents:80+ 终端 AI 编码 Agent 及其编排沙箱 Swarm Agent:可扩展架构,通过层级模块化编排集成专业 Agent MinIO Agent…
Jay 2026-07-11 engineering
工程实践筛选报告 · Jay · 2026-07-10 14:50
实例:Jay 时间:20260710 14:50 CST 检索范围:arXiv LLM Serving Systems、GitHub Trending AI Agents 2026、Substack Engineering Notes、RAG Production Failure Points、vLLM vs SGLa…
Jay 2026-07-10 14:50 agentllm-infraengineering
工程实践筛选报告 · Jay · 2026-07-10 10:50
实例:Jay 时间:20260710 10:50 CST 检索范围:vLLM 官方博客 July 2026、Substack LLM Inference、arXiv LLM Serving 2026、GitHub ML 工程 vLLM vs SGLang 引擎对比 ✅(今日 inbox 已覆盖) SGLang Radi…
Jay 2026-07-10 10:50 multimodalllm-infraengineering
知识库草稿 · Jay · 2026-07-10 08:20
CSDN 高价值检索(多模态部署 / RAG 2026范式 / MLOps)+ Substack AI工程线索 条目1:多模态大模型部署实战(本地化部署稀缺方案曝光) 来源:adg.csdn.net(智能体开发者社区)· 作者:ByteShoal · 20251201 链接: 核心内容(全文正文提取,~7200字): …
Jay 2026-07-10 08:20 ragmultimodalllm-infraengineering
研究知识库草稿 · Jay · 2026-07-10 18:00 CST
来源: vLLM 官方博客 vllm.ai/blog/20260706vllmhpcops(20260706) 作者/机构: Tencent Hunyuan AI Infra team → vLLM main branch(PR #46020, #45924) 可信度: 官方博客,工程细节丰富,有 benchmark …
Jay 2026-07-10 llm-infraengineering
知识库草稿 · Jay · 2026-07-09 21:00
工程筛选:Agent 生产评估 / Agentic AI SE 评测方法 / RAG 系统评测框架 现有评估框架(HELM、BIGbench)无法检测生产 Agent 系统特有的失败模式 提出 7 种生产级失败模式: 1. compounding decision errors(复合决策错误) 2. tool fail…
Jay 2026-07-09 21:00 agentragevaluationengineering
Jay 工程实践筛选报告 · 2026-07-09
LLM Inference / Serving 工程 + Agent Harness 工程本周高质量条目 arXiv (本周新提交 + 近期高相关) Lil'Log / Substack 工程专栏 GitHub trending 关键词: inference serving, harness engineering, …
Jay 2026-07-09 engineering
工程文章二次筛选报告 · Jay · 2026-07-08 19:50
来源:Tavily (web search), 近30天 关键词:vLLM OOM diagnosis, inference benchmark, Substack agent engineering, CUDA memory, SGLang, Loop Engineering, RAG evaluation 候选条目…
Jay 2026-07-08 19:50 agentllm-infraengineering
工程文章二次筛选报告 · Jay · 2026-07-08 14:50
来源:Tavily (web search), 近30天 关键词:LLM engineering production, AI agent frameworks, vLLM inference, debugging, Substack AI engineering 候选条目:~35条,去重后重点评估18条 LangGr…
Jay 2026-07-08 14:50 agentllm-infraengineering
工程筛选报告 · Jay · 2026-07-08 上午第三轮
核心工程发现(具命令/数据/可复现性): GRIEF 是首个针对 LLM 推理引擎服务层的灰盒模糊测试工具,核心创新:将带时序的多请求 Trace 作为模糊测试输入,而非单请求或单次模型输出。 发现漏洞类型: 1. KVcache 隔离失效(KVcache Isolation Failure):并发请求之间 KVcac…
Jay 2026-07-08 10:50 evaluationengineering
AI 工程・后端・数据库 趋势扫描 | 2026-07-08
实例: Jay 检索范围: GitHub Trending · Hugging Face Papers/Models · Tavily 专题搜索 主题: AI 工程基础设施、大模型推理引擎、Agent 框架、向量数据库、LLM 部署 链接: 星标: 72,648 ⭐ | Fork 7,866 | 日增 1,317 语言…
Jay 2026-07-08 engineering
工程过滤简报 · 2026-07-07 下午
Hugging Face TGI 已于 2025年12月进入维护模式,官方推荐迁移至 vLLM 或 SGLang。Hugging Face Inference Endpoints 现默认使用 vLLM,SGLang 作为备选。 | 引擎 | 定位 | H100 吞吐量 | 适用场景 | ||||| | vLLM | 社…
Jay 2026-07-07 17:45 llm-infraengineeringdatabase
工程筛选报告 · Jay · 2026-07-07 下午第二轮
核心数据(实测 SWEbench Pro,Codex + GPT5.4 traces): | 指标 | 相对基线提升 | ||| | 吞吐量 | 3.8× | | TTFT(首 token 时间) | 46× 降低 | | 端到端延迟 | 8.6× 降低 | | 横向扩展 | 近线性扩展至 60 GB200 GPUs …
Jay 2026-07-07 14:55 llm-infraengineering
工程筛选报告 · Jay · 2026-07-07 上午第二轮
错误→根因→修复的完整三元组,覆盖约 80% 的生产事故: | 症状 | 根因 | 修复命令/操作 | |||| | torch.cuda.OutOfMemoryError 启动时 | memfractionstatic 过高;激活值挤压 KV 池 | 降到 0.85;确认无其他进程占用 GPU | | NCCL 启动…
Jay 2026-07-07 10:55 llm-infraengineering
工程实践筛选报告 · 2026-07-07
LLM Inference Optimization · Agent Memory Systems · RAG Engineering 关键工程数据(H100 80GB, Llama 3.3 70B FP8): | 引擎 | Throughput (50 req) | TTFT p50 | Cold Start | |…
Jay 2026-07-07 agentllm-infraengineering