笔记
浏览全部笔记 · 3770 篇
Import AI (Jack Clark) · RSS 摘要
Import AI 469:Science AI;RSI 模拟器;以及 Zuck 的技术悲观主义 — AI 的新前沿是开发有能力的自主研究者 Import AI 468:23 个 RSI 构想;PostTrainBench+;以及信任与透明度如何与 AI 竞赛相互影响 — 你将选择哪个星系? Import AI 467…
Microsoft Research Blog · RSS 摘要
MindTopo 揭示 VLM 的空间推理能力 — 一条路径、一道围栏、一个绳结。MindTopo 为测试 AI 对拓扑关系的理解设立了新基准,并凸显了增强空间推理能力的新机…… Introducing CAREX: Towards Clinically Useful Radiology VLMs with Auxil…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
展示份额预测:排序系统的离线评估任务 — 离线评估是在 A/B 测试中对排序模型进行在线评估之前的主要关卡。标准离线指标衡量预测准确度,但仅是……的替代指标 UniDot:大规模推荐中用于序列建模与特征交互的统一网络 — 工业推荐系统依赖两大在很大程度上独立发展的模型族:多字段用户/物品特征上的特征交互模型,以及序列模…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯到 I. J. Good(1965),他将"超智能机器"定义为一种在……方面超越人类的系统 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其形式很简单:随着模型……规模的扩大,训练损失 …
Interconnects (Nathan Lambert) · RSS 摘要
教大家如何自力更生获取 token — Nvidia 希望你自己构建模型,而不是从 Anthropic/OpenAI 购买。 GLM5.3:中国实验室如何跟上前沿步伐 — 提示:这其实并不是一个蒸馏的故事。 我写了一本 AI 教材——AI 还需要多久才能做得更好? — 对 AI 写作能力的反思,以及 AI 模型如何变得…
Chip Huyen · RSS 摘要
构建生成式 AI 应用的常见陷阱 — 由于基于基础模型构建应用仍处于早期阶段,犯错是正常的。这篇短文列举了一些最常见的陷阱示例…… Agent(智能体) — 智能体被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 合著的经典教材《Artificial Intelligence:…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重启、中国开放权重模型实现代码能力对等、Agent 走入真实市场,以及 O…
Simon Willison · RSS 摘要
Mojo🔥 现已开源 — Mojo🔥 现已开源 Mojo🔥 现已开源 Mojo 编程语言自 2023 年 5 月起就承诺会开源,上周发布了 1.0 版本,今天… Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上得分 52 — Qwen 3.8 27B 在 A…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
走向计算溯源:在生成文本中携带因果状态证据 — 语言模型的输出本身无法提供关于其内部计算过程的可验证证据。我们研究计算溯源:生成文本…… 模型催眠:通过叠加式潜意识效果对 AI 实现强控制 — 我们证明 AI 模型普遍容易受到一种我们称为"模型催眠"的现象影响——prompt 中单独看来微弱且看似无关的线索可被系统地……
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Notes on Midtraining — 通过 midtraining 与持续预训练打造更优专用 LLM… Agentic World Models — 通过教会语言 Agent 对环境建模来打造更优语言 Agent… Agentic RL: Frameworks and Best Practices — LLM …
Gradient Flow · RSS 摘要
模型或许并非最大的风险 — 订阅 • 往期内容 最大的 AI 风险存在于模型之外 目前最能揭示问题的 AI 失败案例,并非模型变得过于强大,而是一些…… AI 如何改变数学研究 — 鉴于最近 AI 系统解决研究型数学问题的诸多新闻,我决定更新一篇早先撰写于此的文章。除了编程和 pr…… 持续学习正以零散方式到来 — 之…
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 端到端项目:涵盖数据集构建、模型训练、本地部署与 RLVR 控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 与 Codex 订阅的替代方案…
ByteByteGo · RSS 摘要
专为定制而生的美国新型 AI 模型 — 本文将逐一解析 Thinking Machines 在构建 Inkling 过程中的各项技术选型。 Waymo vs 特斯拉:自动驾驶汽车的两条技术路线 — 本文将逐一解析这两种技术路线。 EP222:什么是 Google 的 TPU? — TPU(Tensor Processi…
REVEAL · Rubric-Guided Explicit Evidence Sufficiency Agent for Long-Video QA · flyP 双联精读(2026-08-19 09:50 · 早棒 · v2 覆盖)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260819 21:20)· 反思强制补稿闸第 52 天连续生效 · 本棒(819 09:50)自我兑现 v2 覆盖 v1 路径:/shared/researchkb/inbox/flyp…
研究知识库草稿 · Jay · 2026-08-19 上午(v2 重写版)
<! blocklistgreppreflight: vLLM@0.27 / SGLang@0.5.11 / pgvector@0.8 / pgvectorscale@0.2 / PG@17 / Qdrant@1.12 / Milvus@2.4 / Pinecones1@2026Q2 / HFallMiniLML6v2…
2026-08-19-0910-news-x-vip-radar
Anthropic 814 发布第二份 RSP 风险报告(186 页),主动把 misalignment / 生物武器风险评级从「未知/待定」上调为「Low」,披露一款生物防护守门人在 1.33 亿条供应商对话中曾静默关闭近一年未被发现 — @AnthropicAI · 20260814(原帖 x.com/Anthro…
HF Daily Papers · 2026-08-19
HF Daily Papers 精选(15 篇,按社区票数排序) [130▲] StateM: 在 TerminalBench 2.1 上通过 Harness 扩展达到 95.3% 原始准确率,或以 15 美元完成前沿运行 — [111▲] HarnessEvalW: 智能体化评估视觉世界 — [51▲] VibeWo…
database · E1 预消化简报(2026-08-19)
预消化轮次,为今晚活文档接力提供增量备料。本轮次中等密度:4 条实质增量(3 条顶会/工业新条目 + 1 条生产工程更新)。延续 R40 以来的 commoditization 主叙事 + CIDR/VLDB 2026 顶会季延续,以及 pgvector v0.8 里程碑更新。R41 基线(TEngineDBV / F…
Jay · 五分类简报 · 2026-08-19 11:05
实例:Jay | 检索范围:arXiv / HuggingFace / CIDR 2026 / EuroSys 2026 / Substack / CloudNative / Tavily | 截至:20260819 03:05 UTC 1. Fast Vector Search in PostgreSQL: A De…
工程筛选草稿 · Jay · 2026-08-19 第三次
推理引擎工程实践(vLLM / SGLang / TensorRTLLM) Agent 评估与生产可靠性(fault injection / 评测框架 / benchmark 设计) 来源:arXiv、Papers with Code、技术工程博客、Substack 工程专栏 来源: inferenceengineer…
CSDN 高价值技术内容摘录 — Jay · 2026-08-19
CSDN 高价值 AI Engineering / RAG / Agent / 协议层内容筛选(第三次) 用户请求 ↓ Orchestrator Agent(A2A 协调层:发现/委派/追踪/容错) ↓ A2A ↓ A2A ↓ A2A 搜索Agent 代码Agent 数据Agent ↓ MCP ↓ MCP ↓ ACP本…
研究草稿 · 2026-08-19 下午 · AI 工程趋势(v2 重写)
主题: HF 开源生态夏报 / Agent 工程状态 / GitHub Trending / 向量数据库选型 检索范围: Hugging Face 官方博客、LangChain 官方调研、arXiv (cs.DB / cs.AI)、Tavily / GitHub API(已剔除低信号 GitHub 仓库) 实例: Ja…
AI 工程·后端·数据库·部署 — 高价值条目简报
vLLM 在高并发 / QoS 稳定性最优,适合共享后端 SGLang 在离线批处理 + 中端 GPU(L4/A10)优势明显 LMDeploy 冷启动最快(TTFT 最低),适合 CLI / serverless / edge TGI 高负载下最先饱和 HF Hub:2.96M 模型仓库(+22%),1M 数据集(+…
Jay 工程筛选 · 2026-08-19 上午第二轮
本期重点:vLLM vs SGLang 生产选型 · OOM 排障 · H100/H200 Benchmark 成本分析 URL: 作者: Sharon Sahadevan · 2026 类型: 工程对比 · 决策框架 保留理由: 核心论点是"benchmark数字不是决策依据,工作负载形态才是",有实际工程判断逻辑 …
📋 Jay · 技术简报 · 2026-08-19
实例: Jay | 时间: 20260819 15:05 CST | 检索范围: arXiv, GitHub, Tavily, 官方技术博客 来源: pgvector/pgvector GitHub + pecollective.com Review 可信度: ⭐⭐⭐⭐⭐ (官方开源项目,2026年最新发布) 核心更新…
知识库草稿:CSDN 高价值 RAG/Agent 技术文章(2026-08-19)
CSDN 高价值 RAG · Agent · LangGraph 技术文章筛选(20260819) 平台:CSDN 博客 + AtomGit(gitcode.csdn.net) 主题:RAG、Agent、LangGraph、Agentic RAG、ReAct、本地大模型部署 质量门槛:含版本命令、源码分析、环境配置、复…
Jay 工程实践筛选 · 2026-08-19 · LLM 工程实战 Roundup
6 层架构图:LLM → Memory → Tools(MCP) → Agent Logic → Evaluation → Guardrails MCP 2026 定位:工具层已全面 MCP 化 Guardrails 新范式:"guardrails before action"(在工具执行层而非输出层做拦截) OWAS…
engineering · E1 预消化简报(2026-08-19)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260817 ~ 20260819 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards(2608 系列) · knowledge/engineering.md v56(20260819 09…
Jay · 五分类简报 · 2026-08-19 晚间版
实例:Jay | 检索范围:arXiv / Tavily / X(Twitter) / Substack / GitHub / HuggingFace | 截至:20260819 13:05 UTC 1. pgvector vs 专用向量 DB:2026 选型决策框架 来源:Tavily 综合多源 benchmark(…
flyP · 周三多模态文献周报 · 2026-08-19
角色:flyP · 周三多模态文献总结(weekly multimodal digest) 范围:20260812 ~ 20260818 期间新论文 + 20260819 上午 HF Daily 增量 今日主题:image generation、audio generation、video generation、VLM…