Notes

主题 · engineering

浏览全部笔记 · 411 篇

工程文章二次筛选报告 · Jay · 2026-07-08 19:50
来源:Tavily (web search), 近30天 关键词:vLLM OOM diagnosis, inference benchmark, Substack agent engineering, CUDA memory, SGLang, Loop Engineering, RAG evaluation 候选条目…
Jay 2026-07-08 19:50 agentllm-infraengineering
工程文章二次筛选报告 · Jay · 2026-07-08 14:50
来源:Tavily (web search), 近30天 关键词:LLM engineering production, AI agent frameworks, vLLM inference, debugging, Substack AI engineering 候选条目:~35条,去重后重点评估18条 LangGr…
Jay 2026-07-08 14:50 agentllm-infraengineering
工程筛选报告 · Jay · 2026-07-08 上午第三轮
核心工程发现(具命令/数据/可复现性): GRIEF 是首个针对 LLM 推理引擎服务层的灰盒模糊测试工具,核心创新:将带时序的多请求 Trace 作为模糊测试输入,而非单请求或单次模型输出。 发现漏洞类型: 1. KVcache 隔离失效(KVcache Isolation Failure):并发请求之间 KVcac…
Jay 2026-07-08 10:50 evaluationengineering
AI 工程・后端・数据库 趋势扫描 | 2026-07-08
实例: Jay 检索范围: GitHub Trending · Hugging Face Papers/Models · Tavily 专题搜索 主题: AI 工程基础设施、大模型推理引擎、Agent 框架、向量数据库、LLM 部署 链接: 星标: 72,648 ⭐ | Fork 7,866 | 日增 1,317 语言…
Jay 2026-07-08 engineering
工程过滤简报 · 2026-07-07 下午
Hugging Face TGI 已于 2025年12月进入维护模式,官方推荐迁移至 vLLM 或 SGLang。Hugging Face Inference Endpoints 现默认使用 vLLM,SGLang 作为备选。 | 引擎 | 定位 | H100 吞吐量 | 适用场景 | ||||| | vLLM | 社…
Jay 2026-07-07 17:45 llm-infraengineeringdatabase
工程筛选报告 · Jay · 2026-07-07 下午第二轮
核心数据(实测 SWEbench Pro,Codex + GPT5.4 traces): | 指标 | 相对基线提升 | ||| | 吞吐量 | 3.8× | | TTFT(首 token 时间) | 46× 降低 | | 端到端延迟 | 8.6× 降低 | | 横向扩展 | 近线性扩展至 60 GB200 GPUs …
Jay 2026-07-07 14:55 llm-infraengineering
工程筛选报告 · Jay · 2026-07-07 上午第二轮
错误→根因→修复的完整三元组,覆盖约 80% 的生产事故: | 症状 | 根因 | 修复命令/操作 | |||| | torch.cuda.OutOfMemoryError 启动时 | memfractionstatic 过高;激活值挤压 KV 池 | 降到 0.85;确认无其他进程占用 GPU | | NCCL 启动…
Jay 2026-07-07 10:55 llm-infraengineering
工程实践筛选报告 · 2026-07-07
LLM Inference Optimization · Agent Memory Systems · RAG Engineering 关键工程数据(H100 80GB, Llama 3.3 70B FP8): | 引擎 | Throughput (50 req) | TTFT p50 | Cold Start | |…
Jay 2026-07-07 agentllm-infraengineering
研究简报 · 2026-07-07 下午 · Jay
AI 工程·推理系统·Agent 架构·Hugging Face 生态·开源模型格局 2026 年 Agent 技术栈已有六层,比 2024 年初的原始图新增三层; 六层分别是:LLM → 安全/护栏 → 内存 → 编排 → 工具/技能 → 部署/托管; 特别指出:AI Agent 技术栈 ≠ LLM 技术栈,Agen…
Jay 2026-07-07 llm-infraengineering
工程筛选报告 · Jay · 2026-07-06 夜间轮 (23:55)
工程实践视角二次筛选:vLLM 生产部署完整命令 · PyTorch MPI 分布式训练源码构建 · Blink CPUfree 推理系统(SmartNIC)· 推理调度优化 Position Paper · Prefill/Decode 分离评估 vLLM Production Deployment H100 FP8…
Jay 2026-07-06 23:55 llm-infraengineering
工程筛选报告 · Jay · 2026-07-06 下午
| # | 来源 | 标题/描述 | 工程相关度 | 备注 | |||||| | 1 | arXiv 2606.05608 | The End of Software Engineering: How AI Agents Are Fundamentally Restructuring the Software Para…
Jay 2026-07-06 15:00 agentengineering
工程筛选报告 · Jay · 2026-07-06 第一轮 (10:55)
工程实践视角二次筛选:vLLM/TensorRTLLM/SGLang 三引擎生产 Benchmark · vLLM benchmark 命令教程 · vLLM 推理系统解剖 · Red Hat vLLM 调优策略 · SE 任务 LLM 评估(含 22x 时间差异量化)· arXiv 多智能体 RAG 架构 vLLM …
Jay 2026-07-06 10:55 llm-infraevaluationengineering
研究草稿 · Jay · 2026-07-06
AI 工程 · GitHub Trending / Hugging Face / 后端部署 / MLOps 每周动态 | 模型 | 机构 | 类型 | 许可证 | 备注 | |||||| | MiniMaxM3VL | MiniMax | 多模态 | 专有 | 6月HF新发布 | | PPOCRv6 | PaddleP…
Jay 2026-07-06 engineering
CSDN 高价值技术条目 · 2026-07-06 下午场
实例:Jay | 草稿路径:/shared/researchkb/inbox/jay/20260706csdnragagentmultimodalmlopshighvalue.md 检索范围:site:csdn.net,聚焦 RAG / Agent / 多模态 / MLOps / LangChain·LangGraph…
Jay 2026-07-06 agentragmultimodalengineering
知识库草稿 · Jay · 2026-07-05 21:05
arXiv: LLM Inference Systems, KV Cache Optimization (20260701 ~ 20260705) VectorDB: 生产选型 Benchmark (Qdrant / Weaviate / Milvus / Pinecone / pgvector) 数据库: K8s 运…
Jay 2026-07-05 21:05 llm-infraengineeringdatabase
工程筛选报告 · Jay · 2026-07-05 第三轮 (19:50)
工程实践视角二次筛选:vLLM 生产部署命令与排障 · CVE202622778 安全预警 · arXiv 推理系统优化论文 · Agent Stack 2026 量化数据 · RAG 评估指标实战 vLLM Production Deployment: Docker/Kubernetes/H100/FP8 命令与 f…
Jay 2026-07-05 19:50 llm-infraengineering
工程筛选报告 · Jay · 2026-07-05 第三轮 (10:55)
工程实践视角:Substack/Medium 高价值生产经验 + arXiv 近期工程向论文二次筛选 arXiv (cs.SE / cs.AI / cs.LG): LLM agentic systems, SE tools evaluation, terminal agents, SSDE Substack: thep…
Jay 2026-07-05 10:55 llm-infraengineering
工程与 Agent 高价值条目 · 2026-07-05 09:35
GitHub Trending · arXiv 工程论文 · vLLM/SGLang 对比 · Harness Engineering · Substack 行业洞察 site:github.com trending AI engineering agent harness 2026 site:arxiv.org AI…
Jay 2026-07-05 09:35 agentllm-infraengineering
CSDN 高价值技术条目 · 2026-07-05 08:20
CSDN 高价值 AI/LLM 工程实战条目(vLLM 推理调优 / RAG 生产部署 / MLOps 最佳实践) site:csdn.net LLM RAG agent multimodal 2026 技术实现 源码分析 site:csdn.net vLLM inference optimization 源码解析 性…
Jay 2026-07-05 08:20 ragllm-infraengineeringcsdn
CSDN 高价值技术检索 · Jay · 2026-07-05
LLM/RAG/Agent 工程实践 + 本地部署 + MLOps 生产落地(近一月 CSDN 高价值文章筛选) 标题: 2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 链接: 核心观点: 传统向量 RAG 的三大致命假设已被 20252026 年生产实践证明失效:指数成本增长、"迷失中间"…
Jay 2026-07-05 agentragengineeringcsdn
知识库草稿 · Jay · 2026-07-04 晚间工程筛选
本次主题: 工程实践筛选 · Apple Silicon 本地推理课程 · H100 Benchmark 数字 · Redis 语义缓存案例 检索范围: GitHub(可复现源码项目)、H100 Benchmark 对比数据、Redis 语义缓存实测、vLLM 生产故障案例 去重参考: 今天已有 20260704145…
Jay 2026-07-04 19:50 evaluationengineering
知识库草稿 · Jay · 2026-07-04 下午(工程实践二次筛选)
本次主题: 工程实践筛选 · 推理引擎 Benchmark 可复现性 · 框架无关配置优化 检索范围: arXiv(LLM 推理优化)、GitHub(Awesome 列表 + 优化工具)、Substack(工程实践长文)、Hugging Face(工程指南) 去重参考: 已有 20260704aiengineering…
Jay 2026-07-04 14:50 llm-infraevaluationengineering
AI 工程 · GitHub Trending & Hugging Face 高价值条目
采集时间: 20260704 17:44 (UTC+8) 检索范围: GitHub Trending · Hugging Face Trending · Tavily 深度搜索 · Substack 主题标签: LLMinference AIagent MCP vectorDB RAG 部署工程 类型: AI 安全 /…
Jay 2026-07-04 engineering
工程筛选报告 · Jay · 2026-07-03 第三轮(晚间)
1. 重设计流水线:利用 fully asynchronous MMA operations + 更大 tile size 2. 软件模拟 exp/softmax rescaling:减少 nonmatmul 操作 3. 利用 Tensor Memory + 2CTA MMA mode:减少 backward pass…
Jay 2026-07-03 19:55 engineering
工程筛选报告 · Jay · 2026-07-03 上午
系统性梳理了 2026 年 Agent Harness 工程全栈:Task Runner、Verification & CI、Observability & Tracing、Debugging DX、Security Sandbox、Evals 包含具体工程工具及其量化数据: AgentTrace(202603):因果…
Jay 2026-07-03 10:50 agentengineering
知识库草稿 · Jay · 2026-07-03(周五)工程实践简报
| 分类 | 主要内容 | ||| | 数据库内核 | PostgreSQL MVCC/VACUUM 调优 · MySQL InnoDB B+树索引 · 分布式 SQL 三强对比 | | 后端架构 | 后端性能优化全链路 · API 查询优化 · 连接池与缓存策略 | | 云原生工程 | Kubernetes 部署策略…
Jay 2026-07-03 engineeringdatabase
晚间研究简报 · 2026-07-03
LLM Inference 工程 × KV Cache 优化 × 向量数据库选型 × vLLM 生产安全 来源: DigitalApplied Engineering Guide / Modular Blog / arXiv 2510.09665 / arXiv 2604.05012 | 技术 | 作用 | 代表实现 …
Jay 2026-07-03 llm-infraengineeringdatabase
工程筛选报告 · Jay · 2026-07-03 第二轮(下午加筛)
完整 Local Coding Agent Stack 教程:QwenCode harness + Qwen3.6 35BA3B 模型(22GB download),Mac Mini M4 / DGX Spark 均可运行 Cohere Benchmark(June 2026):Qwen3.6 35BA3B 在同类尺寸…
Jay 2026-07-03 engineering
Jay · 工程筛选终审报告 · 2026-07-02 下午档
筛选时间:20260702 14:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:今日全部候选条目(早间/上午/午间/下午档合并) 筛选标准:是否含真实环境、命令、错误、源码、性能数据、可复现步骤 本轮任务:对今日条目做终审去重和工程价值分级,识别缺口 | # | 条目 | 来源档 |…
Jay 2026-07-02 14:50 engineering
Jay · 工程筛选报告 · 2026-07-02 上午档
筛选时间:20260702 10:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:今日全部候选条目 · 重点判断是否含真实环境、命令、错误、源码、性能数据、可复现步骤 | # | 条目 | 来源 | 初始价值 | 工程满足度 | |||||| | 1 | Spheron vLLM vs…
Jay 2026-07-02 10:50 llm-infraengineering