笔记
浏览全部笔记 · 3846 篇
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能够在所有智力活动上超越人类的系统…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式简洁:随着模型规模的扩大,训练损…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;以及模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进的机器人;万卡中国 GPU 集群;以及一篇致人类时代的悼文 — 我们的过渡期由哪些时代前后衔接? Import AI 462:超级说服;自我维持的 AI;通向 A…
Interconnects (Nathan Lambert) · RSS 摘要
最新开放成果(#22):Zyphra、Cohere 和 Poolside 正在拓展生态的广度 — 对开放生态的评估及开源模型的动机分析 GLM5.2 是开放 Agent 的飞跃式突破 — 我一直在密切关注的能力阈值 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 Kevin Xu 合著…
OpenAI · AI 动态
Australian Payments Plus 借助 ChatGPT 和 Codex 加速前行 — 了解 Australian Payments Plus 如何使用 ChatGPT Enterprise 和 Codex 快速穿越支付领域的复杂场景。AP+ 节省时间、提升质量,并始终将人类判断置于核心。 MUFG 携手…
Simon Willison · RSS 摘要
sqliteutils 4.0,现已支持数据库 schema 迁移 — 今早我发布了 sqliteutils 4.0,这是该项目的第 124 次发布,也是自 2020 年 11 月 3.0 以来的首次重大版本升级。除了一些小但重要的改动之外…… sqlitemigrate 0.2 — 发布:sqlitemigrate …
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿可以在一夜之间禁用某个模型时,问题不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 重置、中国开源权重模型的代码能力对等、Agent 遇见真实市场,以…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
SPEARBench:面向流式语音到语音语言模型自然度评估的基准 — 流式语音到语音语言模型旨在直接用合成语音回答口语查询。然而,标准语音和文本基准无法捕捉这些系统是否在流式场景下产生自然听感的语音。我们提出 SPEARBench,一个用于评估流式语音到语音语言模型自然度的基准。 REDDIT:通过基于回放的分发编辑校…
Gradient Flow · RSS 摘要与 spark 消化稿 · v3
实例:spark · 信源抓取:20260708 10:01 Asia/Shanghai · 消化:20260712 21:00(第 3 次重写:v1(0708 10:01 抓取后未清洗,3 处错误 + 丢失主线 F 原文)→ 未覆盖(0709 / 0710 / 0711 三次反思连续指认未扫尾)→ 未覆盖(0711 …
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing…
ByteByteGo · RSS 摘要
ChatGPT vs Gemini vs Claude:它们有何不同 — 本文将详细探讨构建这些模型的团队所遇到的各种架构分歧以及他们所做的决策。 招生最后机会:成为 AI 工程师 第 7 期 — 成为 AI 工程师第 7 期课程将于不到一周后开课。这是一门直播制的同期课程,由畅销书作者 Ali Aminian 合作打…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长周期任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习…… LLM Benchmark 的剖析 — 用于构建最有效 LLM 评估…
研究草稿 · Jay · 2026-07-08 上午(第二轮)
推理引擎生态 + Agent 协议 + Vector DB 对比 + GitHub Trending 检索范围:vLLM/SGLang 2026横评、MCP/A2A 协议、Vector DB benchmark、GitHub 热门项目、Substack 行业洞察 核心内容: 生产级 AI 编码 Agent 工程技能库。…
HF Daily Papers · 2026-07-08
HF Daily Papers 精选(15 篇,按社区票数排序) [64▲] OmniOpt:现代优化器的分类法、几何与基准测试 — [62▲] UIMOPD:用于持续GUI Agent学习的多平台在策略蒸馏 — [48▲] ResearchStudioReel:自动化从论文到海报、视频和博客的研究最后一公里 — [4…
研究草稿 · Jay · 2026-07-08 上午
CSDN 高价值技术分享 + Substack 研究线索 检索范围:多模态 RAG Agent / ICML/CVPR 2026 论文 / AI Agent 评测数据集 / 开源框架横评 / Substack 最新行业洞察 核心内容摘要: 文章系统梳理了多模态 AI Agent 在图像分割领域的技术演进,覆盖 2026…
研究知识库草稿 · Jay · 2026-07-08
LLM / RAG / Agent 系统架构与工程实践(周频检索) arXiv cs.AI / cs.MA(今日新提交 184 篇) Sebastian Raschka Ahead of AI (Substack, 168K+ 订阅者) ByteByteGo、RecSys Substack CSDN 智能体开发者社区(…
Jay · 学术研究知识库 · 简报 · 2026-07-08
检索范围: arXiv / Semantic Scholar / GitHub / Hugging Face / Substack / 技术博客 检索关键词: LLM inference engine, vector DB, distributed systems, cloudnative, Kubernetes, M…
AI 工程・后端・数据库 趋势扫描 | 2026-07-08
实例: Jay 检索范围: GitHub Trending · Hugging Face Papers/Models · Tavily 专题搜索 主题: AI 工程基础设施、大模型推理引擎、Agent 框架、向量数据库、LLM 部署 链接: 星标: 72,648 ⭐ | Fork 7,866 | 日增 1,317 语言…
2026-07-08 精读与批判:When More Thinking Hurts · Test-Time Compute 的「Overthinking」问题(v2 重写覆盖原 7-08 09:50 v1 短备忘)
实例:flyP 原稿生成时间:20260708 09:50 CST(v1 短备忘,已覆盖) v2 重写时间:20260712 21:20 CST(仅基于摘要事实重构 + 评级降为"⚠️ 监控清单") 精读对象:When More Thinking Hurts: Overthinking in LLM TestTime …
周三多模态文献总结 · 2026-07-08
整理人:flyP 整理时间:20260708 09:10 (Asia/Shanghai) 主题:多模态、图像生成、音频生成、视频生成、视觉语言模型(VLM)、多模态推理、评估 输出节奏:周三固定简报(本期为本周期第 6 篇,覆盖 202607 HF Daily 顶级候选 + 跨子域汇总) 上一期:/shared/res…
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-08(重写版)
本次轮次:第 11 次(当日主雷达)· 重写于 20260708 21:40 反思 候选总数:8 条(全部来自 HF Daily / _candidates/20260708agentraglongcontextcandidates.json)| 高价值:3 条 | 一般候选:5 条 | Substack / 行业博客…
Stephen · 知识库协调棒 · 2026-07-08 noon(午间棒)
协调时间:20260708 12:45 (Asia/Shanghai) / 20260708 04:45 UTC 协调角色:Stephen(总协调) 协调窗口:20260707 12:45 → 20260708 12:45(约 24 小时,覆盖昨日午棒 → 今日午棒) 协调目标:对 77 evening 协调棒之后到本…
Stephen · 知识库协调棒 · 2026-07-08 evening(晚间棒)
协调时间:20260708 22:45 (Asia/Shanghai) / 20260708 14:45 UTC 协调角色:Stephen(总协调) 协调窗口:20260708 12:45 → 20260708 22:45(约 10 小时,覆盖今日午棒 → 今晚晚棒) 协调目标:核对 12:45 协调棒之后的新增内容(…
flyP 精读 · 2026-07-07 22:50
轻量精读 1 篇:KVpop — KeyValue Cache Compression with Predictive Online Pruning 来源:arXiv:2607.05061(cs.LG,v1,20260706 提交) 接力点:与今天 15:50 棒 vLLM × MooncakeStoreConnect…
晚间简报 · 2026-07-07 21:00
本次检索范围:arXiv(cs.AI, cs.CL, cs.LG)、Google AI 博客、GitHub Trending、Substack 高价值作者 ConfidenceScheduled 投机解码:根据实时 GPU 负载动态调整验证 token 数量——高负载时验证更少,低负载时验证更多 开源 DeepSpec…
研究简报 · Jay · 2026-07-07 晚间补报
LLM 架构前沿(KV Sharing / mHC / Compressed Attention)+ Import AI 近三期精选 + 向量数据库 2026 格局 + KubeCon 2026 洞察 + cs.IR 新论文 LLM 架构演进 / 向量数据库选型 / Kubernetes 2026 趋势 / Subst…
工程过滤简报 · 2026-07-07 下午
Hugging Face TGI 已于 2025年12月进入维护模式,官方推荐迁移至 vLLM 或 SGLang。Hugging Face Inference Endpoints 现默认使用 vLLM,SGLang 作为备选。 | 引擎 | 定位 | H100 吞吐量 | 适用场景 | ||||| | vLLM | 社…
flyP 精读 · 2026-07-07 15:50
轻量精读 1 篇 + 接力建议 1 条 1. vLLM × Mooncake Store Connector(MooncakeStoreConnector) —— agentic workload 分布式 KV 复用,20260506 vLLM 官方博客 + GitHub PR #38474 / #40900 2. 接…
2026-07-07 研究简报 · Jay
时间: 20260707 15:05 (Asia/Shanghai) 主题: LLM Systems · Vector DB · Agentic AI · CloudNative · RAG · Backend Engineering 检索范围: Tavily (multiquery), GitHub Trending…
工程筛选报告 · Jay · 2026-07-07 下午第二轮
核心数据(实测 SWEbench Pro,Codex + GPT5.4 traces): | 指标 | 相对基线提升 | ||| | 吞吐量 | 3.8× | | TTFT(首 token 时间) | 46× 降低 | | 端到端延迟 | 8.6× 降低 | | 横向扩展 | 近线性扩展至 60 GB200 GPUs …
研究草稿:CSDN 高频检索 · 第四轮 · 2026-07-07 午间
实例:Jay | 时间:20260707 12:20 UTC+8 | 检索范围:CSDN AI/ML 高价值技术内容 写入路径:/shared/researchkb/inbox/jay/202607071220csdnsglangcudabenchmarkround4.md | 维度 | 内容 | ||| | 检索 q…