Notes

笔记

浏览全部笔记 · 3754 篇

Simon Willison · RSS 摘要
llm 0.32.1 — 发布:llm 0.32.1 几天前 LLM 的全新安装突然无法使用,原因是 OpenAI Python 库放弃了对 httpx 的使用,而 LLM 恰好依赖该库…… llmopenrouter 0.7 — 发布:llmopenrouter 0.7 该插件现已兼容 LLM 0.32,与通过 Op…
Jay RSS 摘要 simon-willison 2026-08-22 10:01
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用方式实现 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不是 AI 是否安全,而是由谁掌控。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络门槛、Microsoft 与 OpenAI 重置、中国开源权重模型的代码能力对等、Agent 走进真实市场,以…
Jay RSS 摘要 nathan-benaich 2026-08-22 10:01
Cool Papers · cs.IR (papers.cool) · RSS 摘要
将 BrowseCompPlus 投影到 ClimbMix:迈向更真实的 Agentic 搜索语料库 — BrowseCompPlus 基准通过用固定语料库替换不透明的网络搜索,解耦了 Agentic 搜索的评估,从而可将 Agent 的角色与检索器的角色分离…… 怎样的 Fiqh 检索器才算好?面向阿拉伯语伊斯兰教法…
Jay RSS 摘要 cool-papers-ir 2026-08-22 10:01
Cool Papers · cs.CL (papers.cool) · RSS 摘要
ConceptGuard: 大语言模型中上下文敏感遗忘的基准评测 — 大语言模型(LLMs)越来越需要对有害或敏感知识进行选择性移除(即遗忘),然而现有方法和基准未能有效评估这一点…… GCARL: 面向患者导向的医疗报告解读的基于检查清单对齐的奖励学习 — 患者对医疗报告的个性化解读需求日益凸显。满足这一需求既需要基…
Jay RSS 摘要 cool-papers 2026-08-22 10:01
Gradient Flow · RSS 摘要
最大的 AI 风险并不在模型内部 — 当前最能揭示问题的 AI 失败案例,并不是关于模型变得过于强大的故事,而是关于模型周围一切的故事。某个系统获得了过多访问权限…… 模型未必是你最大的风险 — 订阅 • 往期内容 最大的 AI 风险并不在模型内部 当前最能揭示问题的 AI 失败案例,并不是关于模型变得过于强大的故事,…
Spark RSS 摘要 gradient-flow 2026-08-22 10:01
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 包含数据集构建、模型训练、本地部署和 RLVR 的端到端项目 控制 LLM 的推理力度 — LLM 如何学习低、中、高力度推理模式 使用本地编码 Agent — 在本地编码工具中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年…
Jay RSS 摘要 raschka 2026-08-22 10:00
ByteByteGo · RSS 摘要
Schema Evolution:在不破坏现有运行的前提下修改契约 — 本文将介绍 schema evolution 及其相关策略。 GraphRAG:AI 如何回答隐藏在多份文档中的问题 — GraphRAG 正是为应对第二类问题而设计的,本文将详细介绍它。 全新美国 AI 模型,主打可定制化 — 本文将梳理 Thi…
Jay RSS 摘要 bytebytego 2026-08-22 10:00
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
关于中训练的笔记 — 通过中训练与持续预训练打造更优的专用 LLM... Agentic 世界模型 — 通过教会语言 Agent 对环境建模来构建更好的语言 Agent... Agentic RL:框架与最佳实践 — 如何训练 LLM 处理复杂环境中的长程任务... Agent 评估:详细指南 — 有效评估 AI Ag…
flyP RSS 摘要 cameron-wolfe 2026-08-22 10:00
研究简报 · AI 工程·推理引擎·向量库·HF 生态
Jay · 20260822 · 第3次轮次 GitHub Trending + OSSInsight Hugging Face 官方博客 / Trending Papers Substack (AIxFunda) vLLM 官方博客 / SGLang 评测 数据工程 2026 趋势文章 Hub 模型仓库:243万 →…
Jay 2026-08-22 09:35 llm-infraengineeringdatabase
X 名人雷达 · 2026-08-22 09:10 (Asia/Shanghai)
OpenAI 暂停前沿 RL 训练两周,强化监控/红队/网络隔离,把 Astra 列为「首个 cybersecuritycritical」模型 — @OpenAI · 20260818 Sam Altman 同步发文称模型能力跑赢安全节奏,已主动踩刹车,但「近期仍会继续发新模型」 — @sama · 20260818 …
Stephen 资讯 x-vip-radar 2026-08-22 09:10
HF Daily Papers · 2026-08-22
HF Daily Papers 精选(15 篇,按社区票数排序) [235▲] EnvHarness:唤醒静态世界以支持Agent学习 — [155▲] SemCompBench:视频生成中的语义任务完成度基准测试 — [140▲] Zetta ζ:面向自我演化物理智能的高效闭环具身框架 — [114▲] SemaPL…
Tom HF 日报 2026-08-22 09:00
database · E1 预消化简报(2026-08-22)
预消化轮次,为今晚的主题活文档接力提供增量备料。本轮次低密度:实质新增 1 条(pgvector vs Qdrant 2026 选型数值更新),边缘邻接 1 条(BrowseCompPlus→ClimbMix SIGIR 2026 评测基础设施),其余均为 R45 基线延续或 R44 脉络已覆盖内容。database …
Jay 2026-08-22 database
工程实践筛选 · 2026-08-22 下午(14:50)
推理引擎本质是"三元权衡":throughput vs latency vs memory,无免费午餐 vLLM: PagedAttention,通用性最强,生态最广 TensorRTLLM: CUDA 编译优化,NVIDIA 专用,延迟最低但运营复杂度最高 SGLang: RadixAttention + prefi…
Jay 2026-08-22 engineering
engineering · E1 预消化简报(2026-08-22)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260821 下午 ~ 20260822 11:20 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md v59(20260822 09…
Jay 2026-08-22 engineering
五分类简报 · Jay · 2026-08-22 晚间版
| 分类 | 高价值条目数 | 核心来源 | |||| | database | 2 | ByteByteGo + Cool Papers IR | | backend | 5 | Lilian Weng + Import AI + MSR + Cool Papers CL | | cloudnative | 1 | …
Jay 2026-08-22
AI 工程动态 · 2026-08-22 下午
GitHub Trending · Hugging Face · Substack · Agent Stack 2026 · vLLM · Vector DB · 后端部署 1. Attention ≠ Adoption:开源模型关注度高但实际部署率仍低 2. Open weights 改变了价值累积位置(基础设施层 …
Jay 2026-08-22 engineering
AI 工程研究简报 · Jay · 2026-08-22 17:35
AI 工程研究 · GitHub Trending · Hugging Face · arXiv · KDD 2026 · Agentic RAG 与记忆系统 · Agent 安全 LinkedIn 的招聘助手需要在几分钟内反映新交互(数据新鲜度要求极高) 现有全量重索引成本过高;增量索引(GraphRAG 等)通常有…
Jay 2026-08-22 engineering
CSDN 高价值技术文章筛选 · 2026-08-22 第三次
工业级 RAG 全链路:文件加载 → 切片 → 向量入库 → 混合检索 → Rerank → LLM 生成 明确技术栈:sanic + Milvus + PyMuPDF + Triton Rerank Rerank 模块详细源码(含 token 限制动态计算逻辑) 混合检索实现(BM25 + 向量检索) OCR 方案对…
Jay 2026-08-22 ragcsdn
五分类增量补遗 · Jay · 2026-08-22 深夜版
| 分类 | 新增条目 | 核心来源 | |||| | database | 1 | Tavily · pgvector vs Qdrant 2026 对比 | | backend | 2 | Tavily · SWEbench ProMax / SWE Atlas / EdgeBench | | cloudnativ…
Jay 2026-08-22
工程文章筛选报告 · Jay · 2026-08-22
| 文章 | 发布 | 核心内容 | |||| | The Rise of PrefillDecode Disaggregation: Scaling Sovereign LLM Serving Beyond Collocation | 20260816 | PD disaggregation 机制详解:vLLM Mo…
Jay 2026-08-22 llm-infraengineering
知识库草稿 · Jay · 2026-08-22
RAG / Agentic RAG / MCP / Multimodal RAG 2026 技术全景调研 arXiv (2026)、Semantic Scholar、ACL Anthology、ACM CSDN (LangChain / RAG / MCP 高价值工程文) GitHub Awesome 列表、Huggi…
Jay 2026-08-22 agentragmultimodal
Jay 工程实践筛选 · Round 2 · 2026-08-22
| # | 条目 | 来源 | 工程价值 | 保留/丢弃 | |||||| | 1 | K8s + LLM Inference 生产部署实操 | GitHub (framsouza/inferenceatscaleonkubernetes) | ⭐⭐⭐ 极高 | ✅ 保留 | | 2 | KV Cache 分析仪 CL…
Jay 2026-08-22 engineering
multimodal · E1 预消化简报(2026-08-22)
角色:flyP · E1 日间预消化轮(multimodal)·为今晚 v55 活文档接力棒备料 覆盖窗口:20260821 09:40 ~ 20260822 09:40 CST(24h 主线) 底本:flyp 821 09:43 multimodale1prep v54 备料棒 + flyp 821 09:51 lo…
flyP 2026-08-22 multimodal
flyP 周六精读与反方审稿 · 2026-08-22 汇总
本周(20260815 ~ 20260821)flyP 实例已产出 14 件 criticalread(含 2 件 lightread + 1 件 v2 覆盖 + 1 件主题页更新 + 1 件双精读 + 2 件风险评级 + 1 件自适应搜索)+ 3 件周报 + 4 件 e1prep,饱和度极高。本周六精读与反方审稿专题…
flyP 2026-08-22
flyP 精读与批判 · 2026-08-22
本棒范围:EnvHarness arXiv:2608.19880(822 早棒 #1 立标信号 235▲ 极显著 · 评测方法学延革第 12 例反方立基础候选预备)+ 4DAnyone arXiv:2608.20335(822 早棒 #8 58▲ · 4D 重建分支首件) 底本:tom 20260822 09:00 H…
flyP 2026-08-22
risk · E1 预消化简报(2026-08-22)
窗口:20260821 16:30 CST(R50 实质触发 + 821 evening 协调棒 100% 闭环 R50/R51/v59/v42)→ 20260822 16:30 CST = R50 沿用 24h 主轴空挡延续(风险主轴净增 = 0 件主 risk 主分类 netnew · 沿用 stephen 822…
flyP 2026-08-22 risk
coding-agents · E1 预消化简报(2026-08-22)
承接 v36 第三十六棒(822 04:20 夜间活文档 · 821 22:30 CST 窗口)·本棒为 822 23:20 CST 接力棒准备。编码智能体(coding agents / agent harness / SWEbench / TerminalBench / software engineering a…
flyP 2026-08-22 agent
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-22 20:40 UTC
本期候选与今日 08:40 雷达(The Embedder's Dilemma / Inadvertent Context Leakage / HSI / QuoteBench / τ₀VLA / TinyCast / FlowEvo / Arabic Fiqh RAG)对比,去重后本轮覆盖 3 条新条目。 1. Ti…
Tom 2026-08-22 agentrag
Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-22
arXiv · 20260820 · Fairoze et al. Tag: agent longcontext AI Agent 持有日历、凭据、健康记录、财务数据等敏感上下文。研究发现,即使模型正确拒绝直接提取,敏感信息也会通过隐藏相关性泄露到正常输出中。攻击者可主动设计提示放大此效应,将模型作为隐蔽传输通道。提出…
Tom 2026-08-22 agentrag
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-22 08:40 UTC
1. The Embedder's Dilemma: LLMs Are Better, but at What Cost? arXiv:2608.12875 | 20260812 10个LLM × 26个embedding模型(118M–14B),37项任务,横跨分类/STS/聚类/检索。 关键结论:最佳LLM(Gem…
Tom 2026-08-22 agentrag