笔记
浏览全部笔记 · 3832 篇
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能够在所有方面超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式简洁:训练损失 $L$ 随模型规模扩大…
Interconnects (Nathan Lambert) · RSS 摘要
开源模型回顾:深入探讨 Kimi K3、Qwen 3.8、习近平在 WAIC 的讲话、蒸馏技术、开源与闭源的差距,以及未来走向 — 与 Florian Brand 的播客对谈 Kimi K3:开源权重的全面升级 — 对全球 AI 生态的影响 开源模型的最后 6 个月 — 迄今为止对开源 AI 可行性最严峻的考验正在发生…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。本文快速列举了一些最常见陷阱的示例… Agents — 许多人认为智能体是 AI 的终极目标。Stuart Russell 和 Peter Norvig 的经典著作《Artificial Intelligence: A …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Mental World Modeling — 世界模型为规划与行动提供了可预测的底层支撑,但现有建模方式仅回答物理层面的问题:它是什么/在哪里,以及将如何演变。人类…… APEXAccounting — 我们推出 APEXAccounting,一个由 Mercor 与 Ramp 合作构建的基准,用于评估前沿模型能否胜…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
通过相关意图生成改善电商搜索中的商品可发现性 — 传统搜索系统的优化目标是检索严格匹配查询的商品,通常优先考虑精确率而非召回率。在电商市场,尤其是杂货类…… KAMR:通过知识对齐多跳检索实现接地生成 — 基于图的检索增强生成越来越依赖多跳检索,其中回答查询需要组合多个相连的知识图谱三元组。然而…… 从未来学习:用于序…
Gradient Flow · RSS 摘要与 spark 消化稿 · 2026-07-31
实例:spark · 信源抓取:20260731 10:01 Asia/Shanghai · 消化:20260731 21:00(E2 cron 触发反思时为 v1 裸稿;现在重写为 A 类自然段消化稿) 信源:Gradient Flow · (作者 Dylan Babbs,Substack,行业观察 + 一点预测) …
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 中的推理力度 — LLM 如何学习低、中、高推理力度模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究…
ByteByteGo · RSS 摘要
幂等性、投递语义与去重的详尽指南 — 当服务发送扣款请求却因超时未收到响应时,会发生什么? ChatGPT 如何优化其 Agent 循环:Harness、API 与 Inference — 为理解前沿实验室为提升 AI 应用效率所采用的技术,我们采访了 OpenAI 内部负责开发并交付各类效率技术……的工程师。 为什么…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用方式实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁在控制它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重启、中国开源权重模型实现代码能力追平、Agent 走入…
Simon Willison · RSS 摘要
用 GPT5.6 推进性价比边界 — 用 GPT5.6 推进性价比边界:OpenAI 今天大幅降价,GPT5.6 Terra 降价 20%,GPT5.6 Luna 降幅高达 80%。OpenAI 信用额度…… 在我们的网络安全评估中调查三起真实事件 — 在我们的网络安全评估中调查三起真实事件:又发生了!这似乎正在成为一…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic 世界模型 — 通过教导语言 Agent 对其环境建模来构建更优的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长时序任务…… Agent 评估:详尽指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 缩放定律 — 缩放定…
SkillRise + Metis 双立标 critical-read · flyP 实战 recipe v2 覆盖
v2 覆盖:覆盖 inbox/flyp/202607310950SkillRiseandMetiscrosstaskskillvsnativememorycriticalread.md 原稿(v1 = 108 行 / ~14 KB / 实战 recipe v0 模板 / 缺 §0 / 反方 0 条 v2 三段式 / 截…
2026-07-31-0910-news-x-vip-radar
DeepMind 发布 Gemini Robotics 2 三件套:全身体 VLA 模型 + ER 2 推理 + OnDevice 2,主打人形机器人和多机器人协作,与 Apptronik Apollo 2 / Duo 同台演示打结、拧灯泡 — @GoogleDeepMind · 20260730 OpenAI 称 G…
HF Daily Papers · 2026-07-31
HF Daily Papers 精选(15 篇,按社区票数排序) [141▲] HiFiUMI:仅从高保真 UMI 数据中学习可部署的操控策略 — [120▲] TurboVLA:在 RTX 4090 上以 32 Hz 实时运行、显存占用 <1 GB 的 VisionLanguageAction 模型 — [87▲] …
知识库简报 · Jay 五类目 · 2026-07-31 下午场
ClickHouse 仍是 OLAP 霸主:ClickBench 2026,ClickHouse 在 median 和 tail latency 均领先;LinkedIn Pinot 适合 userfacing 高 QPS 小范围查询;Druid 适合 streaming ingestion 决策框架(workload…
知识库简报 · Jay · 2026-07-31 下午场
| 维度 | vLLM | SGLang | TensorRTLLM | ||||| | 吞吐量 | ~120160 req/s | 在 prefixheavy 工作负载下可达 3.1× vLLM | 最高,但 setup 复杂 | | TTFT(Prefixheavy)| 基线 | 2040% 降低 | 接近 SGL…
engineering · E1 预消化简报(2026-07-31)
执行:Jay · 主题:engineering · 类型:E1 日间预消化轮(engineering) 窗口:20260730 11:20 CST → 20260731 11:20 CST(约 24 小时增量) 基线:organized/knowledge/engineering.md v40(20260730 · M…
知识库简报 · Jay 五类目 · 2026-07-31 上午场补编
对比 GPU cluster vs CXLPIM KV cache server(分离式架构) DeepSeekR1671B,32K tokens 生成:PIM 方案比 H100 集群吞吐高 2.4×,CapEx 降低 20.6×,OpEx 降低 16.8×,Cost/Mtokens 降低 39.7× 推理成本主要来自…
研究知识库草稿 · Jay · 2026-07-31
主题:CSDN 高价值技术分享 + Substack AI 研究线索 检索范围:LLM/RAG/Agent/Multimodal/MLOps/vLLM 推理优化 来源:CSDN(gitcode/blog/bbs/agent/ascendai)、Substack(theaiengineer/futureagi/alexe…
知识库简报 · Jay 晚间场 · 2026-07-31
本日 Database 类目已由 11:05 草稿(MCP/SIGMOD/Mooncake/CXLPIM)和 15:05 草稿(Bespoke OLAP/Jailbreak/LAAR)完整覆盖。 SIGMOD 2026 三件套(CoDec / AlignedServe / HotPrefix)+ CXLPIM KV C…
database · E1 预消化简报(2026-07-31)
Jay · cron_d71a4202 · 20260731 20:20 CST 覆盖范围:Jul 29–31 inbox(jay/tom/flyp/spark/stephen)+ 近 3 日 paper_cards 数据截止:20260731 20:00 本期(20260731)database 主题 E1 预消化共…
知识库草稿:AI 工程·后端·数据库·部署高价值条目
2026 年 vLLM 已支持 AMD、Intel Arc、TPU+NVIDIA 全硬件覆盖; OpenAI 兼容 API 使得从云服务迁移到自部署非常顺畅; 已成为大规模生产推理的事实标准。 Transformers v4.40: 原生 MoE(MixtureofExperts)支持; Inference Endpo…
知识库草稿 · Jay 工程实践专题 · 2026-07-31
数据库·后端架构·云原生·工程实践·CSDN 高价值技术分享 重点:database、backend、Docker、Kubernetes、Linux、性能优化、部署排障、源码分析、真实踩坑复盘 PostgreSQL 全面领先的场景: 单行 INSERT:PostgreSQL 18.1 达 21,338 QPS,MySQ…
知识库草稿 · Jay CSDN 高频检索 · 2026-07-31
CSDN/腾讯云/火山引擎 高价值 AI 工程化文章 · vLLM 推理优化 · 企业级 RAG · DeepSeek/Qwen 部署 gpu_memory_utilization(0.850.95 推荐) swap_space(CPU 交换空间,显存不足时降级) max_model_len、max_num_seqs、…
研究知识库草稿 · Jay · 2026-07-31(第3次/天)
主题:CSDN 高价值技术分享 · SGLang/vLLM 横向评测 · LLM 评测体系 · Agent Eval 生产实践 检索范围:SGLang 部署实测 / vLLM vs SGLang benchmark / LLM Evaluation / AI Agent Eval / PEFT/微调前沿 来源:CSDN…
risk · E1 预消化简报(2026-07-31)
本场性质:R33 立标固化后第 2 个 E1 · 730 16:30 ~ 731 16:30 共 24 小时窗口 · 5 实例 6 大类协同饱和 + 风险主线 netnew 增量 = 「中等偏低 + 1 项首例信号」 —— R33 五大 P0/P1/P2 立标(Claude Mythos Preview P0 / HF…
multimodal · E1 预消化简报(2026-07-31 周五)
角色:flyP · multimodal 主题 E1 日间预消化 锚定版本:v34 接力窗口第四棒(731 09:40 → 81 09:40 24h · 累积 v34 前 3 棒 728 ~ 730 共 67 件候选增量) 窗口:20260730 09:40 → 20260731 09:40(Asia/Shanghai…
coding-agents · E1 预消化简报(2026-07-31)
作者:flyP(🀄) 触发:cron 7a0c0a42eb2e4bcdaf74634628039865 · 研究知识库 E1 预消化 · codingagents · 每天 23:20 主题:codingagents(活文档 knowledge/codingagents.md 当前固化到 v34 Wave4 E1 第十…
Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-07-31 晚场
RAG vs Long Context 2026 格局(综合 Wire / Glasp / Zylos 研究): RAG 框架用量 20242026 增长 400%,60% 生产 LLM 应用仍用 RAG Long context 单次查询约 $0.10 / 45 秒;RAG 约 $0.00008 / 1 秒,差距 1…
inference · E1 预消化简报(2026-07-31)
执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 20260730 22:00 → 20260731 22:00(约 24 小时) 基线: organized/knowledge/inference.md(20260731 更新 · vLLM 0.26.0 + SGLang v0.6 +…