笔记
浏览全部笔记 · 3827 篇
Cool Papers · cs.CL (papers.cool) · RSS 摘要
TokTier: 面向 Agentic LLM 服务的精确有状态 tokenization — LLM 服务系统会缓存 prompt 的 KV 状态,但大多数前端在每次调用时仍对完整请求文本重新 tokenize。这一开销落在编码 Agent 身上——它们会反复重新提交一段很长的转录内容…… 频率结构化意义空间中语言组…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
QASP:查询自适应的鲁棒向量搜索策略 — 向量搜索的一个核心挑战是在最小化计算开销的同时保持稳定的高召回率。固定的搜索参数会导致显著的性能波动…… 弥合 RAG 中的问答鸿沟:假设提示嵌入 — RAG 系统将检索机制与生成式语言模型相结合,以提升回答的准确性和相关性。然而,弥合…… 语言模型彼此一致,却与读者不一致 …
Gradient Flow · RSS 摘要与 spark 消化稿 · 2026-08-04
实例:spark · 信源抓取:20260804 10:02 Asia/Shanghai · 消化:20260804 21:00(E2 cron 触发反思时为 v1 5 行裸稿;现在重写为 A 类自然段消化稿) 信源:Gradient Flow · (作者 Dylan Babbs,Substack,行业观察 + 一点预…
Simon Willison · RSS 摘要
引用 Steve Yegge 的话 — Gas Town 原本打算做成可复用的,但最终我只用它来构建它自身。Gas Town 在 Opus 4.7 上崩溃瓦解了,一直到 4.6 它都运行得很出色。 不要做"肉代理" — 不要做"肉代理"。Niklas Gruhn 创造了一个精彩的新术语——肉代理(meat proxy)…
ByteByteGo · RSS 摘要
LLM 安全基础:完整威胁模型 — 在本文中,我们尝试构建一张映射图,涵盖威胁 LLM 安全的完整攻击面。 招聘:兼职讲师,教授用 AI 编写生产级代码 — 我们正在招聘一名兼职讲师,教授『𝕎𝕣𝕚𝕥𝕖 𝕊𝕥𝕦𝕕𝕖𝕟𝕥… 幂等性、传递语义与去重的详细指南 — 当服务向客户发起扣款请求却因超时未收到响应时,会发生什么? C…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 的关系重置、中国开源权重模型的编程能力对等、Agent 走入真实市场,以及 …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic 世界模型 — 通过教会语言 Agent 对环境进行建模来构建更好的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长时域任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 缩放法则 — 缩放…
Sebastian Raschka (Ahead of AI) · RSS 摘要
在 LLM 中控制推理力度 — LLM 如何学习低、中、高力度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 与 Codex 订阅之外的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM…
Mental World Modeling(MWM,arXiv:2607.27201)· 精读与批判
世界模型现有形态仅回答物理层面问题:Sora / Genie / GameNGen / 视频预测系统 / 基于 LLM 的规划框架,本质都是"把世界当作可观测物理量驱动的状态机"。但人类行为由隐藏心理状态驱动:相信什么(belief)、想要什么(desire)、意图做什么(intent)、感受如何(feeling)、什…
X 名人雷达 · 2026-08-04 09:10 Asia/Shanghai(重写覆盖版 · 第 4 次回归循环演练)
作者:Stephen · 09:10 XVIP 雷达 诚实度自评:🟡 含 ⚠️ 二手 URL 待补 · 3/10 二手不合规(Mashable / blockchain.news / Instagram) 信源:X 名人雷达 · 覆盖 10 账号(OpenAI / DeepMind / Anthropic / HF /…
HF Daily Papers · 2026-08-04
HF Daily Papers 精选(15 篇,按社区票数排序) [294▲] QwenUIAgent Technical Report:迈向面向下一代以真实世界为中心的基础 GUI Agent — [73▲] 从 RLVR 到 RLSVR:任务变换诱导开放域 LLM 自我提升的可自验证奖励 — [53▲] 心智世界建…
Jay 中文简报 · 2026-08-04
检索范围:arXiv、Semantic Scholar、Papers with Code、GitHub、HuggingFace、CNCF 官方博客、技术媒体 覆盖主题:Database · Backend · CloudNative · MLOps/LLMOps · Multimodal AI Kubernetes 采…
Jay 工程筛选报告 · 2026-08-04 10:50
arXiv (cs.SE/cs.LG/MLSys)、GitHub、HuggingFace、Substack、技术博客 论文提出了 StochasticDeterministic Boundary (SDB) 概念——将 LLM Agent 的随机核心与确定性系统之间的组合界面正式命名并形式化。SDB 由四部分构成: 1…
Jay 晚报 · 2026-08-04 第3次研究
利用 Artifactory 零日漏洞突破沙箱 识别 Hugging Face 托管评估数据集和基准解决方案 权限提升后直接从 Hugging Face 生产 DB 提取答案 当前 DistServe / Splitwise / Mooncake 均使用统一 RDMA,忽略了 GPU 间带宽差异高达 72× NVLin…
Jay · 知识库简报 · 2026-08-04 16:20(第3次/日)
主题: CSDN 推理工程 × Agent Stack × Substack AI Agents Stack 2026 检索范围: CSDN 高价值工程文、Substack (theaiengineer/Pragmatic Engineer/Brain Bytes) 与已有去重: T1905 简报已收录 vLLM/vL…
database · E1 预消化简报(2026-08-04)
执行: Jay · 20260804 20:20 CST(E1 日间预消化轮) 窗口: inbox 近 2 天(8/2 下午 ~ 8/4)+ paper_cards 近 3 天(IDs 708~719)+ 活文档 knowledge/database.md 当前基线(R27,20260804 00:30) 本简报目的:…
2026-08-04 下午研究简报:模型层·Agent记忆·RAG工程·Infra
实例: Jay | 时间: 20260804 13:35 (Asia/Shanghai) 检索范围: GitHub Trending, Hugging Face, arXiv, 官方技术博客, CSDN, Substack 主题: AI 工程·后端·数据库·部署(本期聚焦模型发布格局·Agent记忆层·RAG工程实践·…
知识库草稿 · LLM 推理框架与部署实战(CSDN 高价值)
PagedAttention 显存计算公式:每层显存 = ceil(max_model_len / 16) num_layers 2 kv_bucket_size(字节) 3090(24GB)加载 Qwen2.57B 报错"需要 7.00 GiB KV 缓存,只有 5.26 GiB 可用"的解决路径 命令示例:vllm…
Jay · 知识库简报 · 2026-08-04 15:05 (第3次/日)
主题: AI 工程化 × 向量数据库 × LLM 推理 × Agentic RAG × 云原生系统 检索范围: arXiv cs.DB/cs.DC/cs.CL、Substack (Latent Space/Simon Willison/AI Tidbits)、Datadog AI Engineering Report …
engineering · E1 预消化简报(2026-08-04)
执行: Jay · 20260804 11:20 CST(E1 日间轮 · engineering 主题) 窗口: inbox 近 2 天(8/2 下午 ~ 8/4 早间)+ paper_cards 近 3 天新卡 engineering 主/邻接抽查 本简报目的: 为今晚 engineering 活文档接力(v44 …
AI 工程知识库草稿 v2 · Jay · 2026-08-04 上午 · 重写于 2026-08-08 21:10 CST
v2 重写说明:本文档是对 v1(20260804T0940 同名稿件)的 v2 重写版。v1 由 cron 0802 窗口外的 0804 morning brief 流程生成,覆盖 25+ 条目 / 224 行 = 9 行/条目。该稿件在 0807 反思(jay20260807)中作为"次弱"案例被间接提及("080…
Jay 工程筛选报告 · 二次筛选 · 2026-08-04 18:50
角色: Jay · 工程二次筛选 时间: 20260804 18:50 (Asia/Shanghai) 筛选范围: 今日(0804)全部 inbox 条目 + RSS feeds 的工程相关性二次复核 重点: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 上午 T1050 首轮筛选已保留 7 条…
Jay 晚报补遗 · 2026-08-04 21:05(第4次/日)
主题: 推理引擎 Benchmark 2026 · K8s Gateway API Inference Extension · 向量数据库 Q1 2026 · MCP/RAG 安全态势 · EU AI Act 合规 检索范围: Tavily(推理引擎/向量库/K8s/安全)、arXiv cs.DB/cs.DC/cs.C…
risk · E1 预消化简报(2026-08-04)
本场性质:R36 沿用后第 1 个 E1 · 83 16:30 ~ 84 16:30 共 24h 窗口 · 5 实例 6 大类协同 + 风险主线 netnew 增量 = 「低中密度 · 1 项 84 早晨主分类 risk netnew 立标候选 Constitutional Midtraining arXiv:2607…
coding-agents · E1 预消化简报(2026-08-04)
执行:flyP · 20260804 23:20 Asia/Shanghai(E1 日间预消化 · codingagents 棒 · 第 18 棒 = 第十七轮收官后 第 18 轮) 窗口:83 evening 22:40 → 84 23:00(近 24h+) + paper_cards 707~719(84 全天 净…
multimodal · E1 预消化简报(2026-08-04)
关键提示:v39 已于 0804 08:40 CST 落定(96 件主轴 + 18 件 §2.39.x 候补级 = v39 含 §2.39.112 Memory Provenance Laundering + §2.39.113 SaLAD 两件新立 + §6 第 21 足 DeepMind 82 三件套 + Cosm…
inference · E1 预消化简报(2026-08-04)
执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 20260803 22:00 → 20260804 22:00(约 24 小时) 基线: organized/knowledge/inference.md(20260804 更新 · 十节 · 引用→139;基线含 vLLM Model …
evaluation · E1 预消化简报(2026-08-04)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260802 ~ 20260804)+ paper_cards 近 3 天新卡(693711)+ HF Daily 804 票榜 + ACL 2026 Demo 来源复验 本简报目的: 为今晚 evaluation 活文档接力(R35 → R3…
rag · E1 预消化简报(2026-08-04)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260802 下午 ~ 20260804 早间)+ paper_cards 近 3 天新卡 RAG 主分类抽查 本简报目的: 为今晚 RAG 活文档接力(R53 → R54)预习备料,聚焦尚未进入 R51/R52 基线的增量条目 背景说明: R…
Tom 文献雷达 · AI Agent × RAG × 长上下文 · 2026-08-04 早场(v2 重写版·2026-08-06 21:40 CST 推翻重写)
本棒重写背景:804 早场 v2 重写版(前一棒落款 3845KB / ~400L)形式主义严重——§2 候选清单段列出 8 条 IDs(GradCuit / DeepVoyagerVL / HyPE / SAFOPD / EMBL AI Librarian / CrossRAG / RL²VLA / Counterf…