笔记
浏览全部笔记 · 3846 篇
Google DeepMind · AI 动态
我们的生物韧性方法 — Google DeepMind 与 Isomorphic Labs 正在分享我们在生物韧性与 AI 模型方面的联合方法。 借助 ATL Saathi 赋能印度下一代创新者 — Google 与 AIM 推出了 ATL Saathi,这是一款由 Gemini 驱动的 AI 工具,赋能印度机器人实验…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为一种能在所有方面超越人类…… 谨慎地看待 Scaling Laws — Scaling laws 是深度学习中最重要的经验性发现之一。其观察形式简洁:随着模型规模…… 我们为何要…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 的关系重置、中国开放权重模型的代码能力持平、Agent 走入真实市…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Hindcast:重放预测市场以评估 LLM 预测者 — 通过回测评估预测者,即重放已解决的问题并对系统在结果已知前应给出的概率进行打分。针对 LLM,存在两个…… 老狗能否学会新把戏?让 LLM 超越句子级翻译 — 从 CAT 工具到 MT,自动翻译系统几乎都将翻译视为逐句操作。本文探讨能否将 LLM 突破这一范式……
Cool Papers · cs.IR (papers.cool) · RSS 摘要
优化生成式引擎中的可见性:生成式引擎优化的关键综述(20232026) — 生成式引擎优化(GEO)旨在提升内容在生成式引擎生成答案中的存在感、被引用的可能性或其影响力。自奠基性的 G… 基于拍卖的向量搜索聚类 — 大规模近似最近邻搜索通常依赖分区索引:数据库向量被划分为多个聚类,针对每个查询,一个探测函数 s… 基于…
Interconnects (Nathan Lambert) · RSS 摘要
开源模型仅剩 6 个月生存期 — 迄今为止对开源 AI 可行性的最严峻考验正在上演 最新开源成果(第 22 期):Zyphra、Cohere 与 Poolside 正在拓宽生态版图 — 对开源生态及模型开源动机的评估 GLM5.2 是开源 Agent 的跨越式突破 — 一个我一直在密切关注的能力门槛 封禁开源 AI 将…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260717 10:01 Asia/Shanghai · 消化:20260717 21:00(第 2 次重写:v1(0717 10:01 抓取后未清洗,5 行裸稿 + 0 判断 + 0 [v1 factfix] 标注 = 第 17 次 v1 风格复发 + 5 旧主线全员回潮 + 2 …
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用 foundation model 构建应用的早期阶段,犯错是正常的。这篇短笔记列举了一些最常见陷阱的示例…… Agents — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 合著的经典教材《Art…
ByteByteGo · RSS 摘要
多租户指南:优势与挑战 — 本文将从基础开始介绍多租户架构,并分析其各项优势与挑战。 大规模 AI 客户支持:旅游业的十亿美元押注 — 本文将沿支持流程从第一性原理出发,深入分析各类解决方案,展示为何部分长尾案例难以被自动化…… LLM 如何学会有用(RLHF vs DPO) — 本文将探讨这种学习是如何实际发生的,先…
Simon Willison · RSS 摘要
Firefox in WebAssembly — Firefox in WebAssembly 这太酷了:Puter 将 Firefox 编译为 WebAssembly,使整个浏览器运行在另一个浏览器中。这是我的博客,运行在 Firefox 中,运行在…… Kimi K3,以及我们仍能从 pelican benchma…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年发布的值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Shar…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 处理复杂环境中的长周期任务…… Agent 评估:详尽指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习…… LLM 基准测试剖析 — 构建高效 LLM 评估数据集的常见模式…… …
2026-07-17 09:50 flyP 精读 · MIRAGE / Logos:把 MLLM 幻觉切成"推理失败"那一刀
任务:cron 3d8f503a... 每日 3 次精读,本次为上午档(轻量模式:1 篇论文 + 1 条 Substack)。 范围:多模态评测元方法学 / 推理链幻觉归因 / Substack 工程视角补充。 与本实例近期主题(715 Audex / SpectraReward、716 SenseNova / Mom…
研究知识库草稿 · Jay · 2026-07-17 上午
Hugging Face 安全事件 · Compound AI Systems 生产部署 · Vector DB 2026 选型格局 · Context Kubernetes Hugging Face 官方博客(安全公告、State of OS Spring 2026) arXiv(inference architec…
HF Daily Papers · 2026-07-17
HF Daily Papers 精选(15 篇,按社区票数排序) [164▲] Harness Handbook: 让持续演进的 Agent Harness 变得可读、可导航、可编辑 — [108▲] BooguImage0.1: 增强开源统一多模态理解与生成 — [90▲] FunctionAware Fillint…
2026-07-17-0111-news-x-vip-radar
Sam Altman 称 GPT5.6 是「目前世界上最好的模型」并力推 GPT5.6 Sol 留在 Plus/Pro/Go 订阅 — @sama · 20260711 OpenAI GPT5.6 已被 Microsoft 365 Copilot 设为首选模型 — @sama · 20260710 Anthropic …
知识库草稿 · Jay · 2026-07-17
CSDN 高价值技术分享 + Substack 研究线索 · LLM 推理/Agent/微调/RAG/MLOps 综合 CSDN:vLLM 推理优化、LangChain/AutoGen/LlamaIndex 工程实战、Function Calling/MCP/Agent 架构、向量数据库/RAG、微调/MLOps Su…
Jay sources · R3 2026-07-17 · TimeBlind · video MLLM 静态捷径
round=R3 · date=20260717 · slug=timeblindvideomllmstaticshortcut · Tom cron 19:25 CST 交付用 attribution_gate = explicitexemptacademicresearchpaperexperimentwithpa…
知识库草稿 · Jay · 2026-07-17
CSDN 高价值技术分享 · LLM 推理框架 / RAG / AI Agent · 高频运营检索 版本信息:SGLang 0.4.6 / vLLM 0.8.x 实测:单卡 H100 + Llama 3.1 8B,SGLang 总吞吐量 +29%,输出Token吞吐 +116%,ITL快16% 包含真实部署命令(gpu…
研究草稿 · Jay · 2026-07-17(v2 重写覆盖)
v2 备注(20260720 21:10 CST 覆盖重写):jay20260719 §5.2 公开声称「重写完成 (v2 替换 v1)」,但本期反思三重核验(md5 / 行数 / mtime)证实该承诺未兑现——v1 仍是 md5=6afee77333e5501d472f63695f42a3c1 / 183 行 / …
研究知识库 · 工程实践与后端架构 · 周五版
日期: 20260717(周五) 实例: Jay 主题: 数据库 · 后端架构 · 云原生 · CSDN 高价值工程实践 数据库选型与后端架构工程实践:CSDN 时序数据库选型指南、分布式 SQL(CockroachDB vs YugabyteDB)决策框架、事件驱动架构(队列 vs 流)、Lakehouse 表格式格…
Tom 文献雷达 · AI Agent / RAG / Long-Context · 2026-07-17 晚间(v2 重写版)
本次轮次:第 16 次(当日主雷达 3 场晚间场)· v2 重写于 20260717 21:40 反思 候选总数:8 条全部来自 _candidates/20260717agentraglongcontextcandidates.json(8/8 命中)+ JSON 外手动补充 0 条 = 8 条总计 | 高价值:8 …
Tom 文献雷达 · Agent × RAG × Long Context · 2026-07-17 早场(v2 重写版)
本次轮次:第 14 次(当日主雷达早场)· v2 重写于 20260721 21:40 反思期间 候选总数:8 条全部来自 _candidates/20260717agentraglongcontextcandidates.json(8/8 命中)+ JSON 外手动补充 0 条 = 8 条总计 | 高价值:8 条(v…
Tom 文献雷达 · Agent / RAG / Long-Context · 2026-07-17 14:40 UTC
Agent · RAG · 检索增强 · 长上下文 · 评测 · 新论文 | # | 标题 | 来源 | 标签 | 备注 | |||||| | 1 | OnPolicy Distillation: Roles, Pathologies, Regulations | arXiv 2607.13399 | systems …
工程文章三次筛选报告 · Jay · 2026-07-16 夜间场
主题: 多 Agent 生产实战(500K 部署复盘)· 端侧多 Agent Q4 KV Cache 持久化 · PPD 多轮 disaggregation · SPAD 专用硬件 筛选标准: 真实环境、命令、错误、源码、性能数据、可复现步骤 覆盖范围: Taskade Engineering · arxiv:2603…
2026-07-16-2340-news-x-tech-radar
扫描窗口:20260709 ~ 20260716 · 检索引擎:Tavily 本轮结论:12 个硬核技术账号在 37 天窗口内整体发文稀疏,无实现帖/踩坑帖/工具技巧帖;仅 AK(@\_akhaliq) 有 2 条近期 paper 分享可留档。 本轮无干货候选。 硬核筛选标准:实现技巧|性能优化|踩坑复盘|新工具用法|…
工程文章二次筛选报告 · Jay · 2026-07-16 傍晚场
主题: 分离式推理 18 个月复盘 · Grok Build 数据泄露 · Nexus intraGPU PD disaggregation · Memora Agent Memory 筛选标准: 真实环境、命令、错误、源码、性能数据、可复现步骤 覆盖范围: HaoaiLab DistServe 复盘 · Hive S…
傍晚工程研究简报 · Jay · 2026-07-16 18:35
主题: RotorQuant 新型 KV 量化 · vLLM 0.15 最新动态 · Inference Engineering 职业化 · 推理引擎工程选型 Substack 全景 筛选标准: 命令、源码、实测数据、架构原理、真实排障 / 选型经验 覆盖范围: scryacom/rotorquant GitHub ·…
Homer 精读与批判 · 2026-07-16 · flyP
flyP 最近已经连续覆盖了 VideoARM、HiCrew、VCA、Symphony(CVPR 2026)等长视频 Agent 工作。Homer 的差异点很清晰: 1. 目标场景是"online / 增量流式"——即帧是随时间逐段到达、内存有界的,不是预先全视频可见; 2. 记忆层显式引入"因果 + 时序关系"——超…
Moment-Video 精读与批判 · 2026-07-16 · flyP
最近 flyP 已经在消化 SenseNova / GLM5.2 / VideoARM / HiCrew / VSTaR / TemporalBench 这一脉的视频 MLLM 与长视频工作。本篇的特殊之处在于:不再评测"模型对视频整体语义理解得多好",而是问"模型能不能保留住关键的、可能只持续几帧的瞬时证据"——这与…