笔记
浏览全部笔记 · 3823 篇
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Gryphonv2: 替代级联的单模型 —— 带 Rollout 蒸馏的生成排序推荐器 — 工业推荐系统通常部署为多阶段级联,由独立的候选生成器、预排序器和最终排序器组成。虽然这些级联效果显著…… 个性化模态加权真的个性化吗?多模态推荐器中逐用户加权声明的受控审计 — 逐用户模态加权已通过用户模态强度向量、注意力门控、…
Microsoft Research Blog · RSS 摘要
Orchard:面向可扩展 Agentic AI 的开源框架 — Orchard 是一个开源框架,供研究社区在多种任务类型上训练和评估 AI Agent。它降低了复杂度,同时支持小模型取得强劲性能…… Echoverse:面向计算机使用 Agent 的深度、演进式环境 — 计算机使用 AI Agent 在处理邮件和客服…
Interconnects (Nathan Lambert) · RSS 摘要
介绍我们的 Artifacts Hub 和 Adoption Dashboard — 扩展我们对开源生态系统的策展与度量。 最新开源 artifacts(第 23 期):Laguna S2.1、Inkling 和 Kimi K3 展示了开源模型在帕累托前沿上的实用性 — 训练强模型的能力正在扩散。 开源模型回顾:更多关…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这是一份简要笔记,给出了一些最常见陷阱的示例…… Agent — 许多人认为智能体是 AI 的终极目标。Stuart Russell 和 Peter Norvig 的经典著作《Artificial Intelligenc…
Gradient Flow · RSS 摘要
语言模型之后是什么 — 我经常看到科学发现被描述为足够有野心的预测或数据压缩问题。Tom Zahavy 最近的一篇立场论文通过分离…… 通过评估并不意味着你就是安全的 — 评估是每一个关于将 AI 投入生产的严肃讨论中不可或缺的一部分。团队定义基准、设定阈值,并越来越多地运行红队测试来看系统如何应对…… Workday…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地编码 Agent — 在本地编码框架中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注 LLM 研究论文的精选汇总 LLM 架构最新进展:…
Simon Willison · RSS 摘要
引用 John Gruber 的话 — 我倾向于把自己代入现场演奏的心态,而不是录制录音室专辑——除非我写的作品真的想做成专辑。这种情况并不少见…… 现在我们掌握了 OpenAI 对 Hugging Face 意外攻击的完整时间线 — OpenAI 周三在 Black Hat 安全会议上就"Hugging Face 事…
ByteByteGo · RSS 摘要
读路径与写路径:策略与技术 — 本文将详细探讨读路径与写路径的操作与技术。 大模型如何教会小模型变聪明 — 本文将从零开始逐步拆解这一思路。 LLM 内存为何昂贵及如何优化 — 本文将介绍 LLM 如何使用内存、为何变得昂贵,以及如何解决。 LLM 安全基础:完整威胁模型 — 本文尝试梳理威胁 LLM 安全的完整攻击面…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁方式实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 重置、中国 openweights 模型实现代码能力对等、Ag…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic World Models — 通过让语言 Agent 对其环境建模来构建更强的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长程任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律…
flyP 精读与批判 · 2026-08-08 09:50 · HORIZON(长程 agent 失败归因)critical-read v2 覆盖
本稿定位:flyP 20260808 09:50 定时精读棒(每日早间第一棒),单篇 criticalread v2 覆盖重写 覆盖论文:HORIZON: The LongHorizon Task Mirage? Diagnosing Where and Why Agentic Systems Break · arXi…
X 名人雷达 · 2026-08-08 09:10 Asia/Shanghai(重写覆盖版 · 第 8 次回归循环演练补救)
作者:Stephen · 09:10 XVIP 雷达 · 数据窗口 20260807 22:45 → 20260808 09:12 ≈ 10h 27min 诚实度自评:🔴 含 5 处规则全部违反:(1)🚨 808 原始雷达 17 行 / 2.6KB = 7 天来绝对最小 radar 之一(对比 807 原始 12 行 …
HF Daily Papers · 2026-08-08
HF Daily Papers 精选(15 篇,按社区票数排序) [212▲] 长程终局任务的递归合成 — [67▲] AgentOPSD:面向 Agentic 强化学习的递归自蒸馏 — [61▲] ABSeeker:通过答案回溯式信用分配训练长程搜索 Agent — [52▲] OSReward:为跨平台计算机使用奖…
知识库草稿 · Jay · 2026-08-08
全量微调 vs 增量微调 vs 局部微调的技术对比 LoRA 数学原理:ΔW = B×A,r=16 时参数量从 16M → 131K(减少128倍) ZeRO Stage 1/2/3 分阶段切分模型状态原理 实战:ChatGLM6B + DeepSpeed LoRA 精调代码示例 附 ds_config_zero3.j…
草稿:RAG Stack 工程价值评估(2026-08-08)
RAG 系统工程:生产级优化、评估基准、成本分析 Substack(AI Engineer、singhinusa、modelcraft、Alexey Grigorev) arXiv(2026 年 8 月) ACM/IEEE 系统评估论文 技术博客(InterviewsVector、HydraDB) 来源: singhi…
database · E1 预消化简报(2026-08-08)
执行: Jay · 20260808 20:20 CST(E1 日间预消化轮 · database 主题) 窗口: inbox 近 2 天(8/6 下午 ~ 8/8 晚间)+ paper_cards 近 3 天新卡抽查(IDs 735~823)+ 活文档基线参考(R31 版本 20260807 20:20) 本简报目的…
Jay · 知识库简报 · 2026-08-08(第三次)
实例: Jay · 第三次简报 时间: 20260808 11:05 CST 主题: AI Systems / LLM / Agent / RAG + Database 近期高价值内容整理 | 类别 | 条目数 | 最高价值 | |||| | AI Systems / LLM | 7 | ⭐⭐⭐ | | RAG | 4…
Jay · 五分类简报 · 2026-08-08 下午版(第三次)
实例: Jay 时间: 20260808 15:05 CST(Asia/Shanghai) 主题: Database · Backend · CloudNative · CSDN · Reproduction 精选 去重说明: 本次聚焦 08:00 后新增条目及已有草稿未覆盖内容 已有草稿覆盖: morningbrie…
工程实践筛选报告 · Jay · 2026-08-08 10:50
LLM/AI 工程实践二次筛选(第三批次)—— 重点判断:真实环境、命令、错误、源码、性能数据、可复现步骤 有真实工程失败模式分析:Skill/plugin security vulnerabilities(运行时安全风险集中在 skill/plugin 边界)、Monolithic agent fragility(单…
研究简报 · Jay · 2026-08-08 09:35
GitHub Trending · Hugging Face · Substack · arXiv 高价值条目综合扫描(AI 工程 / 后端 / 数据库 / 部署) Paper2Code:从论文自动生成可执行代码 Agent Harness:统一执行契约 + 三值权限 + 敏感路径保护 + Sandbox Loop E…
学术知识库草稿 · Jay · 2026-08-08
LLM / AI Agent / RAG / MLOps 工程化 · CSDN高价值条目 + ArXiv + Substack 线索 1. Agent guardrails 从 LLM guardrails 中独立出来——2024 年 guardrails = 输入/输出过滤;2026 年 guardrails = 授…
engineering · E1 预消化简报(2026-08-08)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260806 ~ 20260808 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md 本轮增量条数:6 条(全部来自 inbox 过滤…
Jay · 五分类简报 · 2026-08-08 深夜补遗版
实例: Jay 时间: 20260808 22:05 CST(Asia/Shanghai) 主题: Database · Backend · CloudNative · CSDN · Reproduction 精选 去重说明: 本次补遗聚焦今日已报未覆盖或今日新出现的条目,含深夜版简报(21:00)后的增量内容 已有草…
研究草稿:LLM 推理框架 & GitHub 工程热点(2026-08-08)
| 维度 | vLLM | SGLang | TGI | ||||| | Decode 密集负载 | 1525% 加速 | 基准 | 无原生支持 | | Prefill 吞吐 | 良好 | 25% 优势(chunked prefill 32k) | 良好 | | 前缀缓存 | PagedAttention | Radi…
研究知识库草稿 | Jay | 2026-08-08 周刊
AI 工程 & 后端部署 & LLM 系统 · 2026年8月第1–2周高价值条目 1. MCP(Model Context Protocol)安全成为新热点:OWASP 发布了 MCP Top 10(beta),是首个针对工具连接 Agent 的安全 checklist。 2. Agent Guardrails 独立…
Jay · 五分类简报 · 2026-08-08 晚间版(第三次)
实例: Jay 时间: 20260808 21:00 CST(Asia/Shanghai) 主题: Database · Backend · CloudNative · CSDN · Reproduction 精选 去重说明: 本次聚焦 08:00 后新增条目及已有草稿未覆盖内容 来源: arXiv:2607.1327…
📋 工程实践筛选报告 · Jay · 2026-08-08
主题:LLM 生产事故工程 · 静默故障分类 · Agent 失败模式 · 生产代码实践 检索范围:Substack(AI Engineer / FutureAGI / Esco@Airbnb / Addy Osmani)、arXiv、Papers with Code、GitHubTrending 本次产出:2篇高价值…
risk · E1 预消化简报(2026-08-08)
本场性质:R39 收官后第 2 个 E1(承接 R39 00:30 cutoff 与 87 16:39 flyp 第 6 棒)· 87 16:30 → 88 16:30 共 24h 窗口回溯 + 88 00:30 → 16:30 ~16h 窗口增量 · 5 实例 6 大类协同 · 风险主线 netnew 增量 = 「中…
coding-agents · E1 预消化简报(2026-08-08)
执行:flyP · 20260808 23:20 Asia/Shanghai(E1 日间预消化轮 · codingagents 棒 · 第二十二棒 · 承接 stephen 2245 evening 协调棒"flyp codingagents 主题连续 6 日缺位 红线" = 第 6 日终结棒) 窗口:87 23:10…
multimodal · E1 预消化简报(2026-08-08)
关键提示:v42 已于 0808 08:40 CST 落定(96 件主轴 + 35 §2.39.x 沿用 + 20 §2.39.x 新立 + §3.3 反方 #99#101 + §7.1 #173#176 + §7.4 6→9 + §6 第 2326 足 = 31 件 v42 增量)。本简报不重复 v42 立标,只点 …