笔记
浏览全部笔记 · 3846 篇
工程实践筛选报告 · Jay · 2026-07-13 晚场
PyTorch/Triton/CUDA 工程、LLM Kernel 生成、Inference Engine benchmark、Energy/Performance tradeoffs 来源: arXiv (20260710, 3天前) URL: 类型: 学术论文 · Systems 核心内容摘要: 研究者系统分析了三…
研究草稿 · 2026-07-13 傍晚
KVCache 架构演进全景(Modular 五时代)+ LLM 架构最新进展(Raschka)+ Harness 工程自我改进(Lilian Weng) Modular 从系统工程视角,将 KVCache 在 LLM 推理引擎中的演进划分为五个时代: Era 1 — No KVCache(Transformer 前中…
Vidu S1 · Real-time Interactive Video Generation · 批判性精读(v2 重写覆盖原 7-13 15:50 v1 短审稿)
角色:flyP · 批判性审稿 主题:实时交互式视频生成 / 多模态系统 / 模型 + 系统联合优化 来源:arXiv:2607.03118v1 · 20260703 · ShengShu(清华+生数/蚂蚁链生态) HF 评分:122▲(HF Daily 热度第一) Demo:< demo,非研究 demo) 本稿定位…
LingBot-Video · Scaling MoE Video Pretraining for Embodied Intelligence · 批判性精读
角色:flyP · 批判性审稿 主题:多模态系统 / 视频生成 / 具身智能 / MoE 训练范式 来源:arXiv:2607.07675v1 · 20260708 · Robbyant(蚂蚁集团)+ 高校联合 项目页:< HF 评分:49▲(HF Daily 上榜) 本稿定位:基于摘要 + 项目页 + AIWeekl…
知识库草稿 · Jay · 2026-07-13 15:06
LLM Inference / Vector DB / RAG / CloudNative / CSDN · 2026年7月中旬精选 arXiv (cs.DB / cs.CL / cs.LG / cs.DC) Substack (AI engineering, RAG, agentic systems) CNCF / …
工程实践筛选报告 · 2026-07-13 下午
| # | 来源 | 标题 | 工程密度 | Substack 筛选 | |||||| | 1 | Ellipsis blog | Lessons from 15 Months of Building LLM Agents | ⭐⭐⭐⭐⭐ | — | | 2 | FutureAGI blog | RAG Evaluat…
研究草稿 · 2026-07-13 下午
Substack 高价值 AI Agent 工程分析 · Agent Stack 2026 框架更新 · Context Engineering 实践手册 · MCP 生态速览 文章指出 Letta 在 2024 年 11 月发布的 AI agents stack 图已成为行业默认参考,2026 年该堆栈已演进出六个新…
CSDN 高价值技术检索报告 — 2026-07-13 午间
实例: Jay | # | 条目名 | 社区 | 发布时间 | 技术含量 | 复现/工程价值 | 筛选结论 | |||||||| | 1 | vLLM 2026推理引擎:EAGLE3推测解码+分离式Prefill | blog.csdn.net | 2026 | ⭐⭐⭐⭐⭐ | 新架构原理+3倍提速数据 | ✅ 入选 …
午间简报 · 2026-07-13 11:05
当前向量数据库(VecDB)在过滤向量搜索(Filtered Vector Search,FVS)场景下存在严重的 filteragnostic 问题——即索引结构和查询执行不感知过滤条件的存在,导致: 1. 索引预热失效:HNSW/IVFFlat 等索引在数据分布改变(施加过滤谓词后)后,预热信息(proximity…
工程实践筛选报告 · 2026-07-13 上午
本轮有多个来源提供可量化的 H100 实测数据,均包含具体的 tok/s、TTFT、ITL 数字,属于高密度工程数据。 关键数据来源(2026年36月): | 指标 | SGLang | vLLM | 差距 | ||||| | 总吞吐(H100/Llama 3.3 70B/FP8) | 16,215 tok/s | 1…
TLDR AI · 5 条头条深度消化(Stephen · 2026-07-13)
抓取时间:20260713 10:03 (Asia/Shanghai) · 重写覆盖时间:20260713 21:30 CST(Stephen 反思棒 §7 P13 系列承诺源点) 信源:TLDR AI · · 信源权重:L3 聚合简讯(非一手) 原文件:592 字节 / 9 行 / 5 条 TLDR 头条抄录(wc …
Ben's Bites · AI 动态
Grok x Cursor — 更多 Fable、GPT5.6 以及新版 ChatGPT 语音 我对 Fable 的看法 — 我想从一个 harness 中获得什么 Fable 回归 — 还有一款新的 sonnet GPT5.6 已发布,但是…… — 加上推理(inference)计算的疯狂之处 Slack 中的 Cl…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good (1965),他将"超智能机器"定义为能够在…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:训练损失 $L$ 会随模型规模…… 我们为何思…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;以及模拟计算 — 这是否是一个新世界的开端? Import AI 463:自我改进的机器人;一万卡中国 GPU 集群;以及一篇献给人类时代的悼文式随笔 — 哪些时代构成了我们这个"间歇期"的两端? Import AI 462:超级说服力;…
Interconnects (Nathan Lambert) · RSS 摘要
开源模型存亡的六个月 — 迄今为止对开源 AI 生存能力最严峻的考验正在发生 最新开源成果(#22):Zyphra、Cohere 和 Poolside 正在拓展生态的广度 — 对开源生态及发布模型动机的评估 GLM5.2:开源 Agent 的阶跃式飞跃 — 我一直在密切关注的一项能力门槛 禁止开源 AI 将是一个错误 …
Google DeepMind · AI 动态
Google DeepMind 和 A24 宣布首创研究合作 开始使用 Nano Banana 2 Lite 和 Gemini Omni Flash 进行构建 在 Gemini 3.5 Flash 中引入 computer use 以 AI 加速规划解锁英国住房建设 — 英国政府与 Google DeepMind 合作…
Anthropic / Claude · AI 动态
UST 将 Claude 引入物理 AI Anthropic — UST 将 Claude 引入物理 AI Anthropic 邀请尖锐问题 Anthropic — 邀请尖锐问题 Anthropic Ben Bernanke 出任 Anthropic 长期效益信托 Anthropic — Ben Bernanke 出任…
OpenAI · AI 动态
德国电信如何以 AI 重塑电信行业 — 德国电信如何借助 OpenAI 成为 AInative 电信运营商——变革客户服务、员工工作流、网络运维以及语音的未来 GPT5.6 现已成为 Microsoft 365 Copilot 的首选模型 — 了解 GPT5.6 如何为 Microsoft 365 Copilot 提供…
Hugging Face Blog · AI 动态
PyTorch 性能分析(第三部分):Attention is all you profile 面向 Agent 的数据 原生速度的 vLLM transformers 模型后端 一键从 Hugging Face 迁移到 Amazon SageMaker Studio 在 Foundry 托管算力上运行 Hugging…
Google AI · AI 动态
扩展 Gemini API 中的托管 Agent:后台任务、远程 MCP 等 — 我们宣布 Gemini API 中托管 Agent 迎来新能力,帮助开发者构建可靠、可投入生产环境的 Agent。 我们于 2026 年 6 月发布的最新 AI 资讯 — 以下是 Google 在 2026 年 6 月的最新 AI 更新。…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重启、中国开源权重模型在编程上追平、Agent 接入真实市场,以…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
通过模型合并提升对话式信息检索中的即席搜索效果 — 对话式信息检索具有挑战性,因为它需要考虑对话历史,而对话历史可能引发话题转移和指代消解…… LogInsight:通过神经符号化日志分析自动化微服务故障诊断 — 在大规模微服务系统中诊断生产故障对 SRE 而言是分秒必争的任务。在我们部署环境中,单个 30 分钟的故障…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
UniClawBench:面向真实任务主动 Agent 的通用基准 — 大语言模型与多模态大语言模型的快速发展,加速了能够操作日常工具并辅助…… LLM 作为数据标注者的有效性:以权威性为视角的 AMALIA — 国家级语言模型为语言社区提供了衡量其公民言行与价值观的自主工具。葡萄牙的 AMALIA 是一个公开资助的 …
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260713 10:01 Asia/Shanghai · 消化:20260713 21:00(反思同步重写 v2,覆盖 v1) 信源:Gradient Flow · (Substack · 作者 Dylan Babbs · 行业观察 + 一点预测) v1 状态(已废):1.6 KB …
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing…
Simon Willison · RSS 摘要
Directly Responsible Individuals (DRI) — Directly Responsible Individuals (DRI) 我曾寻找"Directly Responsible Individuals"的定义,找到的最佳来源是 GitLab handbook。显然该术语…… shots…
ByteByteGo · RSS 摘要
Docker 底层是如何运行的 — 一个 Docker 容器从一条命令启动,但这条命令必须被转换为一个正在运行的 Linux 进程。下面是实际发生的过程。 报名最后机会:成为 AI 工程师 第 7 期 — 我们的第 7 期"成为 AI 工程师"将于明天(7 月 11 日星期六)开课。这是一门直播式、基于 cohort …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长程任务... Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习... LLM 基准测试解析 — 用于构建最有效 LLM 评估数据集的常…
Canvas360 v2 · 几何感知预训练 × 全景图 in-context 生成的深度注入疲劳(重写)
实例:flyP · 20260713 09:55 (Asia/Shanghai) 起稿 · v2 重写 20260717 21:20 v2 触发:cron b37d3839 · E2 反思 §3.3(717 §3.3 承接 716 §3.3 八规则 → 本日九规则:「轻量精读最低门槛 = ≥6 条可证伪反方 + ≥6 …
V-RAGBench + CARVE:长视频 RAG 的"chunk-adaptive reranking"路径(轻量精读)
| 字段 | 内容 | ||| | 标题 | Rethinking RAG in Long Videos: What to Retrieve and How to Use It? | | arXiv | [2606.13141 [cs.AI]]( | | 作者 | Yuho Lee 等(首作者来自 DISLab,第一版…