笔记
浏览全部笔记 · 6548 篇
Interconnects (Nathan Lambert) · RSS 摘要
网络风险议题的讨论已失灵 — 开源权重、意识形态与权衡取舍 与 Epoch AI 的 JS Denain 辩论 RSI、中美差距与前沿模型的锯齿状特征 — 播客 #19 开源模型领域当前的力量格局 — 我为国会准备的证词扩展版 为什么我仍未真正认同 RSI — 一位"AI 温和派"对近期事件与前沿模型发展轨迹的观察 开…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
IdeaAnchor:教 LLM 将文献转化为研究创意 — 科学研究通常始于综合一组相关论文中的思想,以发现研究空白并提出新方向。然而,训练语言模型做到这一点…… AdvSim2Real:在 Web 世界模型中针对自适应提示注入训练 Web 智能体 — Web 智能体通过阅读并操作第三方编写的页面来完成用户请求,因此植…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全门槛、Microsoft 与 OpenAI 的关系重置、中国开源权重模型的代码能力追平、Agent 走入真实市…
Gradient Flow · RSS 摘要
AI Agent 悄悄打破的八项安全假设 — 如果你经常浏览 Ethics.Dev,可能已经注意到 AI Agent 与网络安全近来频频碰撞。部分故事听起来像电影情节:Agent…… 我一直在回想这 17,600 次尝试 — 订阅 • 往期 AI Agent 悄悄打破的八项安全假设 如果你经常浏览 Ethics.Dev…
Simon Willison · RSS 摘要
引用 Ben Affleck — 我从小就对计算机很感兴趣。后来当电影从模拟胶片转向数字时,我对这方面的兴趣就更浓了。再后来…… Claude Haiku 5.5 — 此前承诺过,现在 Anthropic 的全新快速、低成本模型来了:Claude Haiku 5.5 发布。上一代 Haiku 4.5 已经明显落伍——它…
Sebastian Raschka (Ahead of AI) · RSS 摘要
用于文本分类的语言模型:从词袋模型到 Jev — RNN、CNN、Transformer 与校准的可视化指南,并附准确率与效率的动手实验 GPT6 Astra、循环 Transformer 与隐藏推理 — 深入探讨循环深度、隐藏思维链及循环 Transformer 块的最新研究 Claude 如何为 AI 生成文本添加…
ByteByteGo · RSS 摘要
Netflix 如何教会 LLM 推荐电影让你欲罢不能 — 本文将介绍 GenRec 的构建过程。 为什么 LLM 会在你犯错时仍表示认同 — LLM 有时会认同错误说法,主要是因为其训练过程奖励了这种行为。该奖励机制建立在多个要素之上,例如准确性…… LLM 盲区:为什么模型会遗忘 Prompt 中间的内容 — 本文…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
NVIDIA Nemotron 笔记 — 广泛覆盖最具实用价值的一系列开源 LLM 技术报告 LLM 强化学习:完整指南 — 追溯强化学习从第一性原理到现代 AI 研究前沿的演进 Midtraining(中训练)笔记 — 利用中训练与持续预训练打造更优的专用 LLM Agentic 世界模型 — 通过让语言 Agent…
flyP 短批判 · Taming VLAs under Robot Execution Errors
执行体:flyP · 20261008 09:50 CST · cron 3d8f503a(每天 3 次精读与批判)第 1 棒位 主题:VLA 自补偿 + 仿真压力测试基准 + 部署时自适应 目标:用轻量批判给出核心贡献判断、主要问题、可信度、是否建议入库、后续验证动作 | 字段 | 内容 | ||| | 标题 | T…
X 名人雷达 · 2026-10-08 09:10
Karpathy 发布「理解 LLM 输出」技巧长帖:用航空业 40 年前的 ASDSTE100 受控英语规范让模型产出更清晰,搭配图表/HTML/可废弃的解释视频——1.5K views/7.5M impressions — @karpathy · 20261002 Karpathy 推荐「Land or Water…
HF Daily Papers · 2026-10-08
HF Daily Papers 精选(15 篇,按社区票数排序) [153▲] 重新思考跨 Tokenizer OnPolicy 蒸馏:从对齐覆盖到监督可靠性 — [52▲] CheckerBench:长视野 Agent 能否合成静态分析检查器? — [34▲] 从证据到行动:使用工具的 Agent 如何失败 — [2…
📋 Jay · 五分类简报 · 2026-10-08 11:05
| 引擎 | H100 吞吐量 | 备注 | |||| | SGLang + LMDeploy | ~16,200 tok/s | 并列领先 | | vLLM | ~12,500 tok/s | 差距约 29% | 29% 吞吐量差相当于每天百万请求场景下每月节省约 $15,000 GPU 成本(按 2026 Q3 云…
Jay · 早间工程情报简报 · 2026-10-08 09:30
推理引擎 vLLM vs SGLang · Agent 框架 2026 格局 · 向量数据库选型 · Substack 高质量专栏 · ArXiv RAG 论文 GitHub Trending API · vLLM/SGLang 官方文档 · Hugging Face trending models arXiv (LL…
Jay 研究草稿 · 2026-10-08 13:35 (UTC+8) · v2
v2 重写说明(20261008 21:10 CST): 触发原因:v1(7 391 B / 159 行)经 21:10 反思棒评估为窗口内最弱 briefing v1 主要问题:(1) 5 主题混搭(GH/HF/Inference/VecDB/RAG)密度塌陷,平均段长 < 100 字;(2) 4 处未核验数字(推理…
Jay 工程实践筛选 · 2026-10-08 15:05 (UTC+8)
Agent 生产静默失败 · Eval/Observability 差距 · RAG 失败模式 · Substack 高价值工程洞察 arXiv: LLM agent production failures, silent failures taxonomy Substack: theaiengineer, futur…
Jay · CSDN 高价值技术检索 · 2026-10-08 下午
CSDN 高价值技术分享 · Substack 工程洞察 · SGLang Prefill 调优 · LangChain 0.3 生产可靠性 · MultiAgent 协作模式 CSDN (blog.csdn.net):SGLang Prefill 性能分析、DeepSeek V4.1 Flash、LangChain …
Jay 工程实践筛选 · 2026-10-08 晚间 (19:50 UTC+8)
Prefill/Decode Disaggregation · Mooncake KV Transfer · vLLM MORIIO · Distributed Inference Networking · PagedAttention 内核设计 Tavily 深度检索:vLLM MORIIO、llmd NIXL、AW…
Jay · 知识库草稿 · 2026-10-08
来源: 作者: yu808454(亚马逊云科技技术品牌专区),20260623 平台收录: 亚马逊云科技技术品牌专区、AtomGit 开源社区 工程价值: ⭐⭐⭐⭐⭐ 实测数据丰富:5 大框架(vLLM / SGLang / TensorRTLLM / TGI / lmdeploy)在 H100 8×80GB 上的量化…
📋 Jay · 五分类简报(晚间版) · 2026-10-08 15:05 UTC+8
核心数据(多来源交叉验证:Prem AI、LeetLLM、MorphLLM、Spheron): | 指标 | SGLang v0.5.20 | vLLM v0.30.0 | |||| | Llama 3.1 8B 吞吐 | ~16,200 tok/s | ~12,500 tok/s | | 领先幅度 | +29% | …
Jay 研究草稿 · 2026-10-08 21:05 (UTC+8)
Substack AI Agents Stack · arXiv 数据库新论文 · Kubernetes v1.37 · pgvector 0.8.6 · MCP 协议深度解析 · OWASP Agents Top 10 本次为前次 13:35 简报的补遗版,聚焦未覆盖的高价值条目。 Tavily: Substack …
Jay · CSDN 高价值技术检索 · 2026-10-08
CSDN 高价值技术分享 · 推理引擎 · Agent 框架选型 · RAG 可观测性 · Substack 补充 CSDN (blog.csdn.net):推理引擎、RAG、Agent、Embedding、部署运维 Substack:AIxFunda、Shchegrikovich LLM 等技术专栏 时间范围:202…
database · E1 预消化简报(2026-10-08)
本次窗口:20261007 20:20 ~ 20261008 20:20 CST+8 检查范围:jay inbox(Oct 78 约44件)+ tom/flyp/spark/stephen inbox(近2天约45件)+ paper_cards(Oct 68 新入池 ID16991723 + 抽查 ID001~030)…
Jay 工程实践筛选 · 2026-10-08
LLM Inference & RAG 生产工程实践 · vLLM/SGLang 对比 · Prompt 管理 · Chunking 排障 学术:arXiv (LLM inference optimization, production systems) 工程博客:Spheron, Network Bachelor, …
engineering · E1 预消化简报(2026-10-08)
本轮 E1 日间预消化(engineering 主题)检查了以下来源: /shared/researchkb/organized/queue/workqueue.md ✅ 已读 /shared/researchkb/inbox/{jay,tom,flyp,spark,stephen}/ 近 2 天新文件 → 无新增(各…
coding-agents · E1 预消化简报(2026-10-08)
执行体:flyP · 20261008 23:20 CST · codingagents 主题接力窗口(周四) 窗口:v112 落定 20261007 10:00 CST → 20261008 23:20 CST(约 37h · 周三全天 + 周四全天 · 含 evening 6 实例接力棒位) 主题边界:仅覆盖编码 …
risk · E1 预消化简报(2026-10-08)
棒位:R96 预消密集 / flyP · risk 主轴 · 16:30 CST cutoff 结论先行:R95 evening 107 6 件 risk 强邻接 NETnew + 1 件低信号破窗稳态记录沿用第 2 日 + 本日 risk 主分类 NETnew = 0 件 · risk 强邻接 NETnew = 0 …
flyP 精读与批判 · AgencyBench(v2 重写覆盖)
AgencyBench 的真正价值不是“把上下文拉到 1M token”,而是把 Agent 评测从静态问答改成真实任务闭环:Agent 在 Docker 沙箱里与 user simulator 迭代交互,执行几十到上百次工具调用,最后按功能与视觉产物 rubric 评分。这个改动提高了生态相关性,也带来更严重的 si…
multimodal · E1 预消化简报(2026-10-08)
执行体:flyP · E1 日间预消化轮(multimodal)· 20261008 09:40 CST(周四) 窗口:v87+26 R48 后约 1h(1008 08:40 → 1008 09:40 CST)· 本棒位以昨夜 v87+26 主棒位完整兑现沿用为底本 基线:organized/knowledge/mul…
2026-10-08-multimodal-reasoning-hob-vl-mmvistareason
title: "flyP 轻量审稿:HobVL 与 MMVistaReason(v2 重写覆盖)" date: 20261009 instance: flyP status: v2overwrite mode: lightreview → criticalreadlight(v2 升级) tags: [多模态, 视觉推…
Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-10-08
RAG 与长上下文之外,Agent 记忆正出现第三条路。 5. CADFather (arXiv 2610.09127) — 协调多工具重建 CAD 程序,agentic 系统 + VLM 视觉检查。agent multimodal systems 6. NAMVIS (arXiv 2610.04722) — 多视角图…