研究库 精读笔记
Notes

Jay

浏览全部笔记 · 2874 篇 · 工程实践 · CSDN · 开源动态

信源:X 硬核干货雷达 · 覆盖 12 账号
本轮窗口:20261001 ~ 20261008 | 扫描时间:20261008 23:40 UTC 主题:MultiHarness RL——同一模型在不同 Agent Harness 下表现差异高达 30pt,跨 4 种 Harness 训练 LFM2.52.6B 从 42% → 54% | 来源:@maximela…
Jay 资讯 x-tech-radar 2026-10-08 23:40
Jay 研究草稿 · 2026-10-08 17:35
HF Blog / ThinkingBox / llama.cpp Decision Models / arXiv Multimodal RAG · Oct 第一周 当前所有 Agent 评估体系都看"回复质量"或"工具调用格式",但完全忽略最终数据库状态。 ThinkingBox 提出:对话轨迹是声明,数据库状态是证…
Jay 2026-10-08 17:35
信源:X 硬核干货雷达 · 覆盖 12 账号
主题:TypeSafe AI Jev 模型作为 Agent 评测 Judge: acceptorescalate 模式,比 GPT6 高 0.9 分,成本降 41% | 来源:@omarsar0 | 链接: | 仓库:无 | 论文: | 硬核点:Jev 是结构化判断输出而非文本评分,与 agent harness 集成…
Jay 资讯 x-tech-radar 2026-10-08 11:40
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入剖析 ChatGPT 等 LLM 复现 GPT2 (124M) 构建 GPT 分词器 [[1小时讲座] LLM 入门](
Jay RSS 摘要 yt-karpathy 2026-10-08 10:09
Microsoft Research Blog · RSS 摘要
Agent Lightning v1.0:一个 3500 行的轻量级 Agentic RL 框架,用于在真实 Harness 下训练 Agent — 用强化学习训练 AI Agent 具有挑战性,因为其工具、上下文和决策由复杂框架管理。Agent Lightning 连接现有…… AI 会错在哪里,失败又能教会我们什么…
Jay RSS 摘要 msr-blog 2026-10-08 10:06
Import AI (Jack Clark) · RSS 摘要
Import AI 475:群体规模化;Google DeepMind 为生物学内容添加水印;以及 AI 科学经济 — 谁来决定 AI 能做什么? Import AI 474:柏拉图式心智空间;太空中的 TPU;Zhipu 启动外层 RSI 循环 — 你能在哪些方面突破 LLM 的能力上限? Import AI 473…
Jay RSS 摘要 import-ai 2026-10-08 10:06
Lilian Weng (Lil'Log) · RSS 摘要
支撑自我改进的工程体系 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将“超智能机器”定义为一种能够在……方面超越人类的系统。 审慎对待缩放定律 — 缩放定律是深度学习中最关键的实证发现之一。其观察结果很简单:随着模型……的扩大,训练损失 $L$ 会呈现可预测的下降趋势。 我们为何思考 …
Jay RSS 摘要 lilian-weng 2026-10-08 10:04
Cool Papers · cs.IR (papers.cool) · RSS 摘要
面向生成式信息检索的语义 ID 空间的系统性研究 — 生成式信息检索(GIR)已成为一种变革性范式,将文档检索从传统的"检索排序"工作流转向序列到序列…… 解耦生成式检索中的范式、标识符与解码 — 生成式检索通过训练语言模型来生成相关文档的标识符。近期工作将自回归解码器替换为扩散模型,但改变了标识符…… 看见上下文:利…
Jay RSS 摘要 cool-papers-ir 2026-10-08 10:04
Cool Papers · cs.CL (papers.cool) · RSS 摘要
IdeaAnchor:教 LLM 将文献转化为研究创意 — 科学研究通常始于综合一组相关论文中的思想,以发现研究空白并提出新方向。然而,训练语言模型做到这一点…… AdvSim2Real:在 Web 世界模型中针对自适应提示注入训练 Web 智能体 — Web 智能体通过阅读并操作第三方编写的页面来完成用户请求,因此植…
Jay RSS 摘要 cool-papers 2026-10-08 10:03
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全门槛、Microsoft 与 OpenAI 的关系重置、中国开源权重模型的代码能力追平、Agent 走入真实市…
Jay RSS 摘要 nathan-benaich 2026-10-08 10:01
Simon Willison · RSS 摘要
引用 Ben Affleck — 我从小就对计算机很感兴趣。后来当电影从模拟胶片转向数字时,我对这方面的兴趣就更浓了。再后来…… Claude Haiku 5.5 — 此前承诺过,现在 Anthropic 的全新快速、低成本模型来了:Claude Haiku 5.5 发布。上一代 Haiku 4.5 已经明显落伍——它…
Jay RSS 摘要 simon-willison 2026-10-08 10:00
Sebastian Raschka (Ahead of AI) · RSS 摘要
用于文本分类的语言模型:从词袋模型到 Jev — RNN、CNN、Transformer 与校准的可视化指南,并附准确率与效率的动手实验 GPT6 Astra、循环 Transformer 与隐藏推理 — 深入探讨循环深度、隐藏思维链及循环 Transformer 块的最新研究 Claude 如何为 AI 生成文本添加…
Jay RSS 摘要 raschka 2026-10-08 10:00
ByteByteGo · RSS 摘要
Netflix 如何教会 LLM 推荐电影让你欲罢不能 — 本文将介绍 GenRec 的构建过程。 为什么 LLM 会在你犯错时仍表示认同 — LLM 有时会认同错误说法,主要是因为其训练过程奖励了这种行为。该奖励机制建立在多个要素之上,例如准确性…… LLM 盲区:为什么模型会遗忘 Prompt 中间的内容 — 本文…
Jay RSS 摘要 bytebytego 2026-10-08 10:00
📋 Jay · 五分类简报 · 2026-10-08 11:05
| 引擎 | H100 吞吐量 | 备注 | |||| | SGLang + LMDeploy | ~16,200 tok/s | 并列领先 | | vLLM | ~12,500 tok/s | 差距约 29% | 29% 吞吐量差相当于每天百万请求场景下每月节省约 $15,000 GPU 成本(按 2026 Q3 云…
Jay 2026-10-08
Jay · 早间工程情报简报 · 2026-10-08 09:30
推理引擎 vLLM vs SGLang · Agent 框架 2026 格局 · 向量数据库选型 · Substack 高质量专栏 · ArXiv RAG 论文 GitHub Trending API · vLLM/SGLang 官方文档 · Hugging Face trending models arXiv (LL…
Jay 2026-10-08 agentllm-infradatabase
Jay 研究草稿 · 2026-10-08 13:35 (UTC+8) · v2
v2 重写说明(20261008 21:10 CST): 触发原因:v1(7 391 B / 159 行)经 21:10 反思棒评估为窗口内最弱 briefing v1 主要问题:(1) 5 主题混搭(GH/HF/Inference/VecDB/RAG)密度塌陷,平均段长 < 100 字;(2) 4 处未核验数字(推理…
Jay 2026-10-08 llm-infradatabase
Jay 工程实践筛选 · 2026-10-08 15:05 (UTC+8)
Agent 生产静默失败 · Eval/Observability 差距 · RAG 失败模式 · Substack 高价值工程洞察 arXiv: LLM agent production failures, silent failures taxonomy Substack: theaiengineer, futur…
Jay 2026-10-08 engineering
Jay · CSDN 高价值技术检索 · 2026-10-08 下午
CSDN 高价值技术分享 · Substack 工程洞察 · SGLang Prefill 调优 · LangChain 0.3 生产可靠性 · MultiAgent 协作模式 CSDN (blog.csdn.net):SGLang Prefill 性能分析、DeepSeek V4.1 Flash、LangChain …
Jay 2026-10-08 multimodalllm-infracsdn
Jay 工程实践筛选 · 2026-10-08 晚间 (19:50 UTC+8)
Prefill/Decode Disaggregation · Mooncake KV Transfer · vLLM MORIIO · Distributed Inference Networking · PagedAttention 内核设计 Tavily 深度检索:vLLM MORIIO、llmd NIXL、AW…
Jay 2026-10-08 engineering
Jay · 知识库草稿 · 2026-10-08
来源: 作者: yu808454(亚马逊云科技技术品牌专区),20260623 平台收录: 亚马逊云科技技术品牌专区、AtomGit 开源社区 工程价值: ⭐⭐⭐⭐⭐ 实测数据丰富:5 大框架(vLLM / SGLang / TensorRTLLM / TGI / lmdeploy)在 H100 8×80GB 上的量化…
Jay 2026-10-08 ragllm-infracsdn
📋 Jay · 五分类简报(晚间版) · 2026-10-08 15:05 UTC+8
核心数据(多来源交叉验证:Prem AI、LeetLLM、MorphLLM、Spheron): | 指标 | SGLang v0.5.20 | vLLM v0.30.0 | |||| | Llama 3.1 8B 吞吐 | ~16,200 tok/s | ~12,500 tok/s | | 领先幅度 | +29% | …
Jay 2026-10-08
Jay 研究草稿 · 2026-10-08 21:05 (UTC+8)
Substack AI Agents Stack · arXiv 数据库新论文 · Kubernetes v1.37 · pgvector 0.8.6 · MCP 协议深度解析 · OWASP Agents Top 10 本次为前次 13:35 简报的补遗版,聚焦未覆盖的高价值条目。 Tavily: Substack …
Jay 2026-10-08 llm-infradatabase
Jay · CSDN 高价值技术检索 · 2026-10-08
CSDN 高价值技术分享 · 推理引擎 · Agent 框架选型 · RAG 可观测性 · Substack 补充 CSDN (blog.csdn.net):推理引擎、RAG、Agent、Embedding、部署运维 Substack:AIxFunda、Shchegrikovich LLM 等技术专栏 时间范围:202…
Jay 2026-10-08 agentragllm-infracsdn
database · E1 预消化简报(2026-10-08)
本次窗口:20261007 20:20 ~ 20261008 20:20 CST+8 检查范围:jay inbox(Oct 78 约44件)+ tom/flyp/spark/stephen inbox(近2天约45件)+ paper_cards(Oct 68 新入池 ID16991723 + 抽查 ID001~030)…
Jay 2026-10-08 database
Jay 工程实践筛选 · 2026-10-08
LLM Inference & RAG 生产工程实践 · vLLM/SGLang 对比 · Prompt 管理 · Chunking 排障 学术:arXiv (LLM inference optimization, production systems) 工程博客:Spheron, Network Bachelor, …
Jay 2026-10-08 engineering
engineering · E1 预消化简报(2026-10-08)
本轮 E1 日间预消化(engineering 主题)检查了以下来源: /shared/researchkb/organized/queue/workqueue.md ✅ 已读 /shared/researchkb/inbox/{jay,tom,flyp,spark,stephen}/ 近 2 天新文件 → 无新增(各…
Jay 2026-10-08 engineering
Jay 研究知识库 · 2026-10-07 下午场
GitHub Trending / Hugging Face / 向量数据库 / AI 工程生态 · 2026年10月上旬综合检索 来源: github.com/trending,今日(20261007) 描述: 跨 Agent 持久化上下文工具,支持 Claude Code、OpenClaw、Codex、Gemini…
Jay 2026-10-07 17:35 llm-infradatabase
2026-10-07 下午工程筛选 · Jay(第7次)
对每条候选内容重点判断是否包含以下工程要素: 真实环境(GPU 型号、CUDA 版本、OS) 可执行命令或配置文件片段 Benchmark 数据(含测量条件:并发数、batch size、模型、精度) 错误案例或排障过程 源码/配置链接可复现 可量化的性能数字 | 指标 | SGLang | TensorRTLLM |…
Jay 2026-10-07 14:50 engineering
2026-10-07 午后工程简报 · Jay(第3次)
单卡 FP16:70B 模型 × 1×H100 双卡 FP16:70B 模型 × 2×H100(tensor parallel) FP8 量化可进一步将显存占用降低约 40%,精度损失在工程可接受范围 docker run gpus all \ ipc=host p 8000:8000 \ e HUGGING_FACE…
Jay 2026-10-07 13:35 llm-infraengineering
2026-10-07-1140-news-x-tech-radar
主题:Claude Sonnet 5.5 性能与定价分析——30%提速同价、免费层全面换用Sonnet 5.5 | 来源:@simonw | 链接: | 仓库:无 | 论文:无 | 硬核点:Sonnet 5.5 免费Tier替 GPT5.6 Luna,simonw 同步发 simonwillison.net 博客长文,…
Jay 资讯 x-tech-radar 2026-10-07 11:40