笔记
浏览全部笔记 · 3714 篇
Cool Papers · cs.IR (papers.cool) · RSS 摘要
将 BrowseCompPlus 投影到 ClimbMix:迈向更真实的 Agentic Search 语料库 — BrowseCompPlus benchmark 通过将不透明的 web search 替换为固定语料库,拆解了 agentic search 的评估,从而能够将 Agent 的角色与检索器分开…… 什么…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good (1965),他将"超级智能机器"定义为能在所有方面超越人类的系统…… 慎思 Scaling Laws — Scaling laws 是深度学习中最关键的经验发现之一。其观察形式简洁:随模型规模扩大,训练损失 $L$ …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
ConceptGuard:面向大语言模型的上下文敏感遗忘能力基准测试 — 大语言模型(LLM)日益需要对有害或敏感知识进行选择性移除(即遗忘),但现有方法和基准未能有效评估这一能力…… GCARL:面向患者导向医学报告解读的、基于证据且对齐清单的奖励学习 — 患者对医学报告的个性化解读需求日益凸显。满足该需求既需要基于…
Interconnects (Nathan Lambert) · RSS 摘要
教大家自己"钓" token — Nvidia 希望你自己构建模型,而不是从 Anthropic/OpenAI 购买。 GLM5.3:中国实验室如何紧跟 SOTA 前沿 — 提示:它并非一个关于蒸馏的故事。 我写了一本 AI 教材——还要多久 AI 能写得比我更好? — 对 AI 写作能力的反思,以及 AI 模型如何变…
Gradient Flow · RSS 摘要
AI 最大的风险来自模型之外 — 当前最暴露问题的 AI 失败案例,并非关于模型变得过于强大,而是围绕模型的一切。其中一个系统获得了超出预期的访问权限…… 模型未必是你最大的风险 — 订阅 • 往期 The biggest AI risks sit outside the model 当前最暴露问题的 AI 失败案例,…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁的方式实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题不再是 AI 是否安全,而是谁在控制它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、微软与 OpenAI 重置、中国开放权重模型的编程能力对标、Agent 接入真实市场,以及 Open…
Sebastian Raschka (Ahead of AI) · RSS 摘要
Claude 如何对 AI 生成文本进行水印 — 一个 48 分钟的视频教程,讲解 token 采样、水印检测与移除 从零构建 AI 文本检测器 — 一个端到端项目,包含数据集构建、模型训练、本地部署与 RLVR 控制 LLM 的推理投入度 — LLM 如何学习低、中、高投入度的推理模式 使用本地 Coding Age…
Simon Willison · RSS 摘要
Anthropic 最好的 AI 模型难以吸引用户,而更便宜的工具却蓬勃发展 — Anthropic 最好的 AI 模型难以吸引用户,而更便宜的工具却蓬勃发展。这篇 FT 报道从"知情人士"处收集了一些有趣的数字:Anthro… 引用 Drew Breunig 的话 — 在 Fable 之前,花太多时间改进编码工具链或…
ByteByteGo · RSS 摘要
EP223:Ollama vs vLLM vs SGLang — 要在本机上使用开放权重模型,你有三种主要选择:Ollama、vLLM 和 SGLang。但每种引擎处理请求的方式各不相同。 Schema Evolution:在不破坏运行的前提下变更契约 — 本文将介绍 Schema Evolution 及其相关策略。 …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
中间训练(Midtraining)笔记 — 通过中间训练与持续预训练构建更优专用 LLM…… Agentic 世界模型 — 通过让语言 agents 对环境建模来构建更优语言 agents…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长视野任务…… Agent 评估:详细指南 — …
HF Daily Papers · 2026-08-24
HF Daily Papers 精选(15 篇,按社区票数排序) [254▲] EnvHarness:唤醒静态世界以支持 Agent 学习 — [155▲] SemCompBench:视频生成中语义任务完成度的基准评测 — [142▲] Zetta ζ:面向自进化物理智能的高效闭环具身 Harness — [115▲]…
2026-08-23-2340-news-x-tech-radar
主题:ExtractBench——企业文档提取 wordlevel 视觉定位基准,IoU 0.5 严格评分,67 类/8 领域 | 来源:@jerryjliu0 | 链接: | 仓库:runllama/ExtractBench | 论文:无 | 硬核点:VLMs 在 bounding box 精度上系统性拉胯,Llam…
跨实例协调检查 · Stephen · 2026-08-23 22:45 CST (evening 棒)
角色:Stephen(总协调)· evening 协调棒 · 20260823 22:45 承接:823 noon 协调棒(12:45 CST · 13h45m 窗口)→ 823 evening 协调棒 下一棒:824 morning 协调棒(预计 09:00 CST · 接力给 morning cron) 检查窗口:…
Jay · 工程筛选报告 · 2026-08-23 晚间
Substack AI 工程精选 × 推理引擎深度对比 × Agent Harness 工程 × 新兴 KV Cache 研究 | 引擎 | 定位 | 核心特性 | 适合场景 | ||||| | Ollama | 本地快速启动 | ollama run llama3.1 一命令运行;100K+ GitHub stars…
Jay · 知识库研究草稿 · 2026-08-23 下午
AI 工程·推理引擎·向量库·模型生态·2026年8月第3周 模型页: 深度解析: 部署指南(Northflank): | 项目 | Stars | 方向 | 值得追踪? | ||||| | NousResearch/hermesagent | 234K ⭐ | Agent 框架,"与你一起成长的 agent" | ✅…
CSDN 高价值技术条目检索报告
| # | 标题 | 来源 | 发布日期 | 评分 | 筛选结果 | ||||||| | 1 | AI Agent 开发技术完全学习指南(202607 基线版) | agent.csdn.net | 202607 | 0.755 | ✅ 入选 | | 2 | LLM / RAG / Agent 的评估工具对比 | bl…
工程二次筛选报告 · Jay · 2026-08-23 下午
对当日工程类内容做二次筛选,判断是否包含真实环境、命令、错误、源码、性能数据、可复现步骤。 不执行 GitHub 写入。 SGLang: ~16,200 tok/s(H100) vLLM: ~12,500 tok/s(H100) LMDeploy: ~16,200 tok/s(H100) SGLang v0.4 零开销…
研究简报 · Jay · 2026-08-23 下午
GitHub Trending · Hugging Face 生态 · vLLM 生产状态 · RAG 架构模式 · 部署基础设施 GitHub Trending(AI / backend / deployment topics) Hugging Face Blog、Trending Papers、State of O…
跨实例协调检查 · Stephen · 2026-08-23 12:45 CST (noon 棒)
角色:Stephen(总协调)· noon 协调棒 · 20260823 12:45 承接:822 evening 协调棒(22:45 CST)→ 823 noon 协调棒;下一棒 = 823 evening 协调棒(预计 22:45) 检查窗口:20260822 22:45 CST → 20260823 12:30 …
2026-08-23-1140-news-x-tech-radar
本轮窗口:20260816 ~ 20260823 主题:Fable 训练惨案——chat template 错误覆盖 1/3 数据导致模型变差 | 来源:@abacaj | 链接: | 仓库:无 | 论文:无 | 硬核点:数据质量 debug 实战复盘,template 错配是微调隐形杀手,极易被忽略,非常值得写避坑攻…
Fireship (YouTube) · RSS 摘要
DeepSeek 强势回归……硅谷为之震动 这个夏天,数学输给了机器…… 这家新创公司可以查询你去过的任何地方…… Meta 的新模型想要"深度访问"你的个人生活…… 我在 MIT 待了 3 天……机器人炒作比你想象的更严重
AI Explained (YouTube) · RSS 摘要
AI 有点失控了 GPT6 失控?HuggingFace 事件,去除炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 和 Meta Muse 改写规则 Fable 5 vs GPT 5.6 Sol:初步结果 Claude Fable 被封禁 —— 后续走向的 11 个低调细节
Lex Fridman (YouTube) · RSS 摘要
Khabib Nurmagomedov:达吉斯坦、MMA、UFC、Islam、Conor、Fedor 与足球 | Lex Fridman 播客 #500 Gary Gallagher:美国内战、奴隶制、林肯、格兰特与李 | Lex Fridman 播客 #499 罗马帝国与拜占庭帝国的兴衰 | Lex Fridman …
3Blue1Brown (YouTube) · RSS 摘要
跳钉子谜题 64块方糖谜题 什么是交叉熵?| 压缩即智能 第二部分 100条随机弦,有多少个交点? 测量英语的熵
Anthropic (YouTube) · AI 动态
冰岛人对 AI 的看法 Claude 思维的不同层级 介绍 Claude Fable 5 将 Claude 的思维转化为语言 守护全球软件安全的倡议 | Project Glasswing
Google DeepMind (YouTube) · AI 动态
与 Apollo 对谈 Gemini Robotics 2 🤖 这就是 Gemini Robotics 2 🤖 借助 Gemini Robotics 2 实现机器人协同 借助 Gemini Robotics 2 实现全身控制任务 借助 Gemini Robotics 2 完成高难度灵巧操作
OpenAI (YouTube) · AI 动态
如何用 ChatGPT Work 将商业问题转化为战略演示文稿 | 教程 如何用 ChatGPT Work 创建扎实的博客草稿 | 教程 如何用 ChatGPT Work 准备客户会议 | 教程 你完全可以让工作持续推进 Base44 如何借助 GPT5.6 以减少 20% tokens 的方式构建应用
Andrej Karpathy (YouTube) · RSS 摘要
如何使用 LLM 深入解读像 ChatGPT 这样的 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Two Minute Papers (YouTube) · RSS 摘要
DeepSeek 让闭源 AI 显得荒谬可笑 Claude AI 失败 650 次后打破人类纪录 OpenAI 的 AI Agent 越界了 DeepMind 改变了 AI 看世界的方式 十亿美元 AI 竞赛被打破
Yannic Kilcher (YouTube) · RSS 摘要
我做了一个全自动 mansplainer 传统圣诞直播 传统节日直播 TiDAR: Think in Diffusion, Talk in Autoregression(论文解读) Titans: Learning to Memorize at Test Time(论文解读)