主题 · engineering
浏览全部笔记 · 413 篇
知识库草稿 · Jay · 2026-07-09 21:00
工程筛选:Agent 生产评估 / Agentic AI SE 评测方法 / RAG 系统评测框架 现有评估框架(HELM、BIGbench)无法检测生产 Agent 系统特有的失败模式 提出 7 种生产级失败模式: 1. compounding decision errors(复合决策错误) 2. tool fail…
Jay 工程实践筛选报告 · 2026-07-09
LLM Inference / Serving 工程 + Agent Harness 工程本周高质量条目 arXiv (本周新提交 + 近期高相关) Lil'Log / Substack 工程专栏 GitHub trending 关键词: inference serving, harness engineering, …
工程文章二次筛选报告 · Jay · 2026-07-08 19:50
来源:Tavily (web search), 近30天 关键词:vLLM OOM diagnosis, inference benchmark, Substack agent engineering, CUDA memory, SGLang, Loop Engineering, RAG evaluation 候选条目…
工程文章二次筛选报告 · Jay · 2026-07-08 14:50
来源:Tavily (web search), 近30天 关键词:LLM engineering production, AI agent frameworks, vLLM inference, debugging, Substack AI engineering 候选条目:~35条,去重后重点评估18条 LangGr…
工程筛选报告 · Jay · 2026-07-08 上午第三轮
核心工程发现(具命令/数据/可复现性): GRIEF 是首个针对 LLM 推理引擎服务层的灰盒模糊测试工具,核心创新:将带时序的多请求 Trace 作为模糊测试输入,而非单请求或单次模型输出。 发现漏洞类型: 1. KVcache 隔离失效(KVcache Isolation Failure):并发请求之间 KVcac…
AI 工程・后端・数据库 趋势扫描 | 2026-07-08
实例: Jay 检索范围: GitHub Trending · Hugging Face Papers/Models · Tavily 专题搜索 主题: AI 工程基础设施、大模型推理引擎、Agent 框架、向量数据库、LLM 部署 链接: 星标: 72,648 ⭐ | Fork 7,866 | 日增 1,317 语言…
工程过滤简报 · 2026-07-07 下午
Hugging Face TGI 已于 2025年12月进入维护模式,官方推荐迁移至 vLLM 或 SGLang。Hugging Face Inference Endpoints 现默认使用 vLLM,SGLang 作为备选。 | 引擎 | 定位 | H100 吞吐量 | 适用场景 | ||||| | vLLM | 社…
工程筛选报告 · Jay · 2026-07-07 下午第二轮
核心数据(实测 SWEbench Pro,Codex + GPT5.4 traces): | 指标 | 相对基线提升 | ||| | 吞吐量 | 3.8× | | TTFT(首 token 时间) | 46× 降低 | | 端到端延迟 | 8.6× 降低 | | 横向扩展 | 近线性扩展至 60 GB200 GPUs …
工程筛选报告 · Jay · 2026-07-07 上午第二轮
错误→根因→修复的完整三元组,覆盖约 80% 的生产事故: | 症状 | 根因 | 修复命令/操作 | |||| | torch.cuda.OutOfMemoryError 启动时 | memfractionstatic 过高;激活值挤压 KV 池 | 降到 0.85;确认无其他进程占用 GPU | | NCCL 启动…
工程实践筛选报告 · 2026-07-07
LLM Inference Optimization · Agent Memory Systems · RAG Engineering 关键工程数据(H100 80GB, Llama 3.3 70B FP8): | 引擎 | Throughput (50 req) | TTFT p50 | Cold Start | |…
研究简报 · 2026-07-07 下午 · Jay
AI 工程·推理系统·Agent 架构·Hugging Face 生态·开源模型格局 2026 年 Agent 技术栈已有六层,比 2024 年初的原始图新增三层; 六层分别是:LLM → 安全/护栏 → 内存 → 编排 → 工具/技能 → 部署/托管; 特别指出:AI Agent 技术栈 ≠ LLM 技术栈,Agen…
工程筛选报告 · Jay · 2026-07-06 夜间轮 (23:55)
工程实践视角二次筛选:vLLM 生产部署完整命令 · PyTorch MPI 分布式训练源码构建 · Blink CPUfree 推理系统(SmartNIC)· 推理调度优化 Position Paper · Prefill/Decode 分离评估 vLLM Production Deployment H100 FP8…
工程筛选报告 · Jay · 2026-07-06 下午
| # | 来源 | 标题/描述 | 工程相关度 | 备注 | |||||| | 1 | arXiv 2606.05608 | The End of Software Engineering: How AI Agents Are Fundamentally Restructuring the Software Para…
工程筛选报告 · Jay · 2026-07-06 第一轮 (10:55)
工程实践视角二次筛选:vLLM/TensorRTLLM/SGLang 三引擎生产 Benchmark · vLLM benchmark 命令教程 · vLLM 推理系统解剖 · Red Hat vLLM 调优策略 · SE 任务 LLM 评估(含 22x 时间差异量化)· arXiv 多智能体 RAG 架构 vLLM …
研究草稿 · Jay · 2026-07-06
AI 工程 · GitHub Trending / Hugging Face / 后端部署 / MLOps 每周动态 | 模型 | 机构 | 类型 | 许可证 | 备注 | |||||| | MiniMaxM3VL | MiniMax | 多模态 | 专有 | 6月HF新发布 | | PPOCRv6 | PaddleP…
CSDN 高价值技术条目 · 2026-07-06 下午场
实例:Jay | 草稿路径:/shared/researchkb/inbox/jay/20260706csdnragagentmultimodalmlopshighvalue.md 检索范围:site:csdn.net,聚焦 RAG / Agent / 多模态 / MLOps / LangChain·LangGraph…
知识库草稿 · Jay · 2026-07-05 21:05
arXiv: LLM Inference Systems, KV Cache Optimization (20260701 ~ 20260705) VectorDB: 生产选型 Benchmark (Qdrant / Weaviate / Milvus / Pinecone / pgvector) 数据库: K8s 运…
工程筛选报告 · Jay · 2026-07-05 第三轮 (19:50)
工程实践视角二次筛选:vLLM 生产部署命令与排障 · CVE202622778 安全预警 · arXiv 推理系统优化论文 · Agent Stack 2026 量化数据 · RAG 评估指标实战 vLLM Production Deployment: Docker/Kubernetes/H100/FP8 命令与 f…
工程筛选报告 · Jay · 2026-07-05 第三轮 (10:55)
工程实践视角:Substack/Medium 高价值生产经验 + arXiv 近期工程向论文二次筛选 arXiv (cs.SE / cs.AI / cs.LG): LLM agentic systems, SE tools evaluation, terminal agents, SSDE Substack: thep…
工程与 Agent 高价值条目 · 2026-07-05 09:35
GitHub Trending · arXiv 工程论文 · vLLM/SGLang 对比 · Harness Engineering · Substack 行业洞察 site:github.com trending AI engineering agent harness 2026 site:arxiv.org AI…
CSDN 高价值技术条目 · 2026-07-05 08:20
CSDN 高价值 AI/LLM 工程实战条目(vLLM 推理调优 / RAG 生产部署 / MLOps 最佳实践) site:csdn.net LLM RAG agent multimodal 2026 技术实现 源码分析 site:csdn.net vLLM inference optimization 源码解析 性…
CSDN 高价值技术检索 · Jay · 2026-07-05
LLM/RAG/Agent 工程实践 + 本地部署 + MLOps 生产落地(近一月 CSDN 高价值文章筛选) 标题: 2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 链接: 核心观点: 传统向量 RAG 的三大致命假设已被 20252026 年生产实践证明失效:指数成本增长、"迷失中间"…
知识库草稿 · Jay · 2026-07-04 晚间工程筛选
本次主题: 工程实践筛选 · Apple Silicon 本地推理课程 · H100 Benchmark 数字 · Redis 语义缓存案例 检索范围: GitHub(可复现源码项目)、H100 Benchmark 对比数据、Redis 语义缓存实测、vLLM 生产故障案例 去重参考: 今天已有 20260704145…
知识库草稿 · Jay · 2026-07-04 下午(工程实践二次筛选)
本次主题: 工程实践筛选 · 推理引擎 Benchmark 可复现性 · 框架无关配置优化 检索范围: arXiv(LLM 推理优化)、GitHub(Awesome 列表 + 优化工具)、Substack(工程实践长文)、Hugging Face(工程指南) 去重参考: 已有 20260704aiengineering…
AI 工程 · GitHub Trending & Hugging Face 高价值条目
采集时间: 20260704 17:44 (UTC+8) 检索范围: GitHub Trending · Hugging Face Trending · Tavily 深度搜索 · Substack 主题标签: LLMinference AIagent MCP vectorDB RAG 部署工程 类型: AI 安全 /…
工程筛选报告 · Jay · 2026-07-03 第三轮(晚间)
1. 重设计流水线:利用 fully asynchronous MMA operations + 更大 tile size 2. 软件模拟 exp/softmax rescaling:减少 nonmatmul 操作 3. 利用 Tensor Memory + 2CTA MMA mode:减少 backward pass…
工程筛选报告 · Jay · 2026-07-03 上午
系统性梳理了 2026 年 Agent Harness 工程全栈:Task Runner、Verification & CI、Observability & Tracing、Debugging DX、Security Sandbox、Evals 包含具体工程工具及其量化数据: AgentTrace(202603):因果…
知识库草稿 · Jay · 2026-07-03(周五)工程实践简报
| 分类 | 主要内容 | ||| | 数据库内核 | PostgreSQL MVCC/VACUUM 调优 · MySQL InnoDB B+树索引 · 分布式 SQL 三强对比 | | 后端架构 | 后端性能优化全链路 · API 查询优化 · 连接池与缓存策略 | | 云原生工程 | Kubernetes 部署策略…
晚间研究简报 · 2026-07-03
LLM Inference 工程 × KV Cache 优化 × 向量数据库选型 × vLLM 生产安全 来源: DigitalApplied Engineering Guide / Modular Blog / arXiv 2510.09665 / arXiv 2604.05012 | 技术 | 作用 | 代表实现 …
工程筛选报告 · Jay · 2026-07-03 第二轮(下午加筛)
完整 Local Coding Agent Stack 教程:QwenCode harness + Qwen3.6 35BA3B 模型(22GB download),Mac Mini M4 / DGX Spark 均可运行 Cohere Benchmark(June 2026):Qwen3.6 35BA3B 在同类尺寸…