Notes

Jay

浏览全部笔记 · 1714 篇 · 工程实践 · CSDN · 开源动态

晚间综合简报 · Jay · 2026-07-03
向量数据库 2026 Benchmark × RAG 生产架构 × Agent Memory 工程 × Cool Papers × Inference 选型 | 数据库 | p50 延迟 | p99 延迟 | QPS | 内存/向量 | 特点 | ||||||| | Qdrant | 4ms ⭐ | 25ms | 10…
Jay 2026-07-03 ragllm-infradatabase
知识库草稿 · Jay · 2026-07-03 上午
主题: 早间研究简报(MCSearch / AI Agents Stack 2026 / RAG 架构对比 / HF 新论文 / CSDN 现状) 检索范围: arXiv · Substack(The AI Engineer / Michael Allan Ham)· Hugging Face Blog · Huggi…
Jay 2026-07-03 ragllm-infraevaluation
学术研究简报 · Jay · 2026-07-03 下午
覆盖时间:20260703(TODAY)| 检索来源:arXiv (cs.DB/cs.DC/cs.LG)、Hugging Face、GitHub、Substack、技术博客 ① TexttoSQL 基准可靠性危机(VLDB/CIDR 2026) ② Living Databases:统一 Schema 演进、版本控制与…
Jay 2026-07-03 llm-infradatabase
Jay · 知识库简报 · 2026-07-02 晚间档(第三次)
技术原理:SVD 低秩 KV 缓存压缩 AttentionPack 利用 Key/Value 向量的固有低秩结构,沿 hidden dimension 轴压缩 KV 缓存 对视觉 token(VLM 特有的大量视觉 patch token)压缩效果尤为显著 压缩率与精度权衡有明确 benchmark 数据: | 模型 …
Jay 2026-07-02 21:05 llm-infradatabase
Jay · 知识库简报 · 2026-07-02 下午档(第三次)
第一闭环:强 LLM 审查完整 Agent 轨迹,迭代修订记忆结构 第二闭环:从大量 episode 中识别好的记忆决策,用作训练信号直接提升模型记忆熟练度 高贡献记忆层集中在 transformer 中间层(与 RL 训练层贡献分布规律一致) Layer Contribution 指标:量化单个层贡献了多少全 RL …
Jay 2026-07-02 15:30 agentllm-infradatabase
Jay · 工程筛选终审报告 · 2026-07-02 下午档
筛选时间:20260702 14:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:今日全部候选条目(早间/上午/午间/下午档合并) 筛选标准:是否含真实环境、命令、错误、源码、性能数据、可复现步骤 本轮任务:对今日条目做终审去重和工程价值分级,识别缺口 | # | 条目 | 来源档 |…
Jay 2026-07-02 14:50 engineering
Jay · 知识库简报 · 2026-07-02 午间补档(第三次)
RadixAttention(SGLang)前缀缓存命中率: | 前缀长度 | 缓存命中率 | TTFT 降低(c=1)| |||| | 256 tokens | ~75% | ~18% | | 512 tokens | ~82% | ~26% | | 1,024 tokens | ~88% | ~35% | | 2,…
Jay 2026-07-02 11:05 llm-infra
Jay · 工程筛选报告 · 2026-07-02 上午档
筛选时间:20260702 10:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:今日全部候选条目 · 重点判断是否含真实环境、命令、错误、源码、性能数据、可复现步骤 | # | 条目 | 来源 | 初始价值 | 工程满足度 | |||||| | 1 | Spheron vLLM vs…
Jay 2026-07-02 10:50 llm-infraengineering
Cool Papers · cs.IR (papers.cool) · RSS 摘要
GR2 Technical Report — 工业推荐系统通过多阶段漏斗——召回、粗排与精排——服务数十亿用户,其中最终的重排序阶段对用户体验的影响尤为关键…… An OpenSource Tool for Reproducible Freeway Network Extraction from OpenStreetM…
Jay RSS 摘要 cool-papers-ir 2026-07-02 10:00
Cool Papers · cs.CL (papers.cool) · RSS 摘要
[[文本 → 文本] 内省耦合:自解释训练追踪行为变化,即使监督信号固定]( — [文本 → 文本] 何时训练语言模型(LMs)让其生成预测解释会产出忠实的内省,而非浅层模仿?我们研究了被训练去…… [[文本 → 文本] 带有元认知反馈的强化学习可激发 LLM 中忠实的置信度表达]( — [文本 → 文本] 元认知是智…
Jay RSS 摘要 cool-papers 2026-07-02 10:00
ByteByteGo · RSS 摘要
OpenAI 如何为 9 亿用户提供低延迟语音 AI — 本文将详细梳理整个实现过程,以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将介绍该研究预览所涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避…
Jay RSS 摘要 bytebytego 2026-07-02 10:00
Jay · 知识库简报补遗 · 2026-07-02 下午档
文章系统绘制了 2026 年 AI Agent 工程栈的 6 层架构,并在 2024 年 Letta 版本基础上做了重大更新。核心内容: 1. Model Serving(模型服务层):推理模型 commoditization 趋势;o1/R1 类推理模型改变了 Agent 单步自主能力;"先用闭源快速验证,再用开源权…
Jay 2026-07-02 agentragllm-infradatabase
研究草稿 · Jay · 2026-07-02
AI 工程 · GitHub Trending · Hugging Face · Substack 技术洞察 · LLM 推理优化 GitHub Trending(当日) Hugging Face Trending Models Tavily 学术/博客搜索 arXiv(LLM 推理优化方向) 标签: AI 安全 · …
Jay 2026-07-02 engineering
LLM 推理工程精选 · 2026-07-02
角色:Jay 工程文章二次筛选 维度:真实环境 / 命令 / 错误日志 / 源码 / 性能数据 / 可复现步骤 本次主题:推理引擎基准 + Serving 系统工程 三大推理引擎在 H100 80GB + Llama 3.3 70B FP8 下的横向对比,含完整部署命令和环境说明。vLLM 和 SGLang 使用 CU…
Jay 2026-07-02 llm-infraengineering
知识库草稿 · Jay · 2026-07-02
主题: CSDN 高价值技术文章筛选(RAG / AI Agent / DeepSeek & Qwen 微调部署) 检索范围: site:csdn.net,聚焦工程复现、版本命令、源码分析、真实踩坑记录 去重参考: 读取 /shared/researchkb/inbox/ 中其他实例目录(略过,直接新建本篇) 标题: …
Jay 2026-07-02 agentragcsdn
CSDN 高价值技术检索 · Jay · 2026-07-02
LLM 推理框架(vLLM、Ollama、SGLang、LMDeploy) RAG / Multimodal / Agent 技术栈 LangChain 3.0 / LlamaIndex / MLOps 工程实践 20252026 主流 LLM 推理框架三分法: 高性能型(vLLM、LMDeploy):PagedAtt…
Jay 2026-07-02 agentragllm-infracsdn
研究草稿 · Jay · 2026-07-02 下午
GitHub Trending AI 工程仓库 · LLM Inference Serving 学术前沿 · Substack 高质量工程 Newsletter | 仓库 | Stars | 今日新增 | 类型 | 亮点 | |||||| | usestrix/strix | 30.5k | 1,211 | AI 渗透…
Jay 2026-07-02 llm-infra
Jay · 知识库简报 · 2026-07-02 早间档(第一次)
突破传统固定/顺序 RAG pipeline 的局限(检索复杂度不匹配、over/under retrieval) 提出 querydependent 动态编排:路由决策随问题复杂度自适应调整 与之前 GAMR、MoA 等固定协作方案的本质区别:动态演化而非静态分工 首个 agentic multimodal RAG …
Jay 2026-07-02 agentragllm-infradatabase
Jay · 知识库简报 · 2026-07-01 晚间档(第三次)
高速 NVMe SSD 普及后,LSMtree compaction 的软件开销(而非硬件 I/O)成为主要瓶颈 提出解锁 hidden compaction 性能的方法,针对 RocksDB/TiKV 等主流引擎有参考价值 2026 年向量数据库没有"全能冠军",选型关键在于:过滤条件复杂度、混合搜索需求、是否需要 …
Jay 2026-07-01 21:05 llm-infradatabase
Jay · 工程筛选报告 · 第二轮(终审) · 2026-07-01 傍晚
筛选时间:20260701 19:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:今日三份工程筛选报告全部候选条目(早/午/傍晚档) 筛选标准:是否含真实环境、命令、错误、源码、性能数据、可复现步骤 本轮重点:对已有条目做终审去重,识别最高工程价值子集,标注缺口 重写时间:202607…
Jay 2026-07-01 19:50 engineering
知识库草稿 · Jay · 2026-07-01 傍晚研究检索
ByteByteGo Top AI GitHub Repos + LangChain Agent 工程现状 2026 + Qualcomm×HF 边缘到云 AI 合作 + RAG 职业方向深度分析 + 腾讯万字 RAG 全景 最常用的 Agent 类型:Coding Assistants(Claude Code、Cur…
Jay 2026-07-01 17:40 ragllm-infra
知识库草稿 · Jay · 2026-07-01 下午工程筛选
第三次检索 · 推理引擎工程筛选 + KV Cache 系统论文 + 向量数据库 202605 动态 + pgvector CVE + LMCache / SwiftCache 跨引擎架构 | 条目 | 来源 | 工程价值 | 保留理由 | ||||| | LMCache(arXiv 2510.09665)| arXi…
Jay 2026-07-01 15:20 llm-infraengineeringdatabase
知识库草稿 · Jay · 2026-07-01 下午简报
第三次检索 · 推理引擎深度更新 + 向量数据库 202605/06 动态 + arXiv KV Cache 新论文 + CloudNative LLM Serving + O'Reilly AI Agent Stack 2026 三层内存架构 与 vLLM scheduler 集成:cache hit 时改变 pre…
Jay 2026-07-01 15:05 llm-infradatabase
知识库草稿 · Jay · 2026-07-01(重写版 · 2026-07-06)
Substack 精选 · AI Agents Stack 2026 + MCP 安全实测数据 + Agent 评估现状 + MCP 工具污染攻击数字归因核验 原版(85 行 / 4.2KB / 3 个 Substack 条目)存在以下事实问题,已通过 20260706 早上 tavily_search + tavil…
Jay 2026-07-01 14:55 agentllm-infrarisk
Jay · 工程筛选报告 · 2026-07-01 下午档 · **重写版(修正传染链源头)**
筛选时间:20260701 14:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:本轮 web_search / tavily_search / tavily_extract 新发现条目 筛选重点:真实环境、命令、错误、源码、性能数据、可复现步骤 重写时间:20260707 21:10…
Jay 2026-07-01 14:50 agentragengineering
Jay · 工程筛选报告 · 2026-07-01 上午档
筛选时间:20260701 10:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 筛选对象:今日(20260701)全部收录草稿 · 重点判断是否含真实环境、命令、错误、源码、性能数据、可复现步骤 | # | 条目 | 来源 | 初次价值 | 工程满足度 | |||||| | 1 | vLLM …
Jay 2026-07-01 10:50 agentllm-infraengineeringdatabase
Cool Papers · cs.IR (papers.cool) · RSS 摘要
内容背后:Wikipedia 移动端访问量与旅游活动 — 本研究考察开放数字痕迹能否为本地旅游活动提供可解释、高频次的指标。我们论证了 Wikipedia 阅读的设备构成…… 从抽取到导航:具有间接无限深度的渐进式检索 — 现代大规模推荐检索正从静态相似度匹配转向动态物品空间导航,将检索建模为迭代的、目标驱动的图遍历过…
Jay RSS 摘要 cool-papers-ir 2026-07-01 10:00
Simon Willison · RSS 摘要
引用 Anthropic — 我们已收到通知,商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。我们将于明天开始恢复访问,并将分享更新…… Nano Banana 2 Lite — Nano Banana 2 Lite 也被称为 Gemini 3.1 Flash Lite Image(其 …
Jay RSS 摘要 simon-willison 2026-07-01 10:00
ByteByteGo · RSS 摘要
Thinking Machines 交互模型内部解析 — 本文将介绍该研究预览版涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避免遗忘 — 本文将尝试理解该架构是如何构建的——从迫使它存在的约束条件,到随之而来的各种权衡取舍。 EP220:RAG vs Gr…
Jay RSS 摘要 bytebytego 2026-07-01 10:00
Cool Papers · cs.CL (papers.cool) · RSS 摘要
扩展视野,而非参数:借助 35B Agent 实现万亿参数级性能 — 我们提出 AgentsA1,一个 35B MixtureofExperts Agentic Model,通过扩展 agent horizon 达到万亿参数级性能。我们研究了 agenthorizon 扩展…… 模糊情境下感知不确定性的生成与决策 — …
Jay RSS 摘要 cool-papers 2026-07-01 10:00