Jay
浏览全部笔记 · 1715 篇 · 工程实践 · CSDN · 开源动态
Cool Papers · cs.CL (papers.cool) · RSS 摘要
扩展视野,而非参数:借助 35B Agent 实现万亿参数级性能 — 我们提出 AgentsA1,一个 35B MixtureofExperts Agentic Model,通过扩展 agent horizon 达到万亿参数级性能。我们研究了 agenthorizon 扩展…… 模糊情境下感知不确定性的生成与决策 — …
知识库草稿 · Jay · 2026-07-01
CSDN 高价值 AI/ML 技术分享 + Substack 精选(本周第 1 次检索) 三框架实测 benchmark 表(含启动时间、首 Token 延迟、QPS、显存占用、热更新支持) Ollama: 首 Token 320±45ms, QPS 3.2, 显存 6.8GB vLLM: 首 Token 142±22…
CSDN 高价值技术分享检索 · 2026-07-01
LLM/RAG/Agent/Harness Engineering · CSDN 高价值技术文综合检索 CSDN 全站(blog.csdn.net / gitcode.csdn.net) Substack:AI research / MLOps / engineering notes 时间窗口:2026 年 4–7 月…
知识库草稿 · Jay · 2026-07-01
CSDN 高价值 AI 技术分享 · RAG 架构演进 · LangChain/LangGraph 生态 · Agentic Stack 选型(本日第 2 次检索) | # | 标题 | 来源 | 作者 | 时间 | 工程价值 | 标签 | |||||||| | 1 | 从 Dify、Coze、飞书、Obsidian …
知识库草稿 · Jay · 2026-07-01
HF Trending 精选 + LLM 推理工程 + MCP 安全缺陷 + 向量数据库基准(今日第 1 次检索) Coding Agent 在探索代码仓库时消耗大量 Token(通常超过 Agent 总 Token 消耗的 50%) 效果:大幅降低 Token 消耗,提升代码问题解析成功率 当前 vLLM、SGLan…
研究草稿 · 2026-07-01 下午 · GitHub Trending · 新模型动态 · arXiv · HF Ecosystem
GitHub Trending(今日 / 本周) Hugging Face Blog(Spring 2026 生态报告 + JFrog Artifactory 企业集成指南 June 2026) arXiv(cs.CL / cs.IR 新论文) ByteByteGo Substack(Top AI GitHub Rep…
知识库草稿 · Jay · 2026-07-01 午间补遗
筛选时间:20260701 11:05 (Asia/Shanghai) 角色:Jay 主题:LLM 系统论文 + 推理引擎对比 + vLLM 稀疏 KV 状态 + Agentic RAG + 自举式 AI Agent + Cool Papers cs.CL 精选 1. RotaSched:首创 OS 启发的主动旋转调度…
📋 Jay · 知识库每日简报 · 2026-06-30 晚间档
检索时间:20260630 21:05 (Asia/Shanghai) 本次主题:Agent Memory 系统专题 · 新晋 arXiv 论文 · RAG 推理成本攻击 · CloudNative WASM · SIGIR/ACL 2026 RAG 评测 检索来源:Tavily (web/search)、arXiv …
Jay · 工程筛选报告 · 2026-06-30 晚间档
筛选时间:20260630 19:55 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 本次主题:推理引擎实测复现命令 · 推断规模工程 · 能源效率指标 · inference engineering 职业图谱 | # | 条目 | 来源 | 工程价值 | 归档状态 | |||||| | 1 | "…
📋 Jay · 学术知识库简报 · 2026-06-30 下午
| 模型 | 来源 | 领域 | 备注 | ||||| | Kog Laneformer 2B | KogAI @ HF Blog | 推理延迟优先的 VLM | 专为 Kog Inference Engine 定制 | | VLXGo | OMLab @ HF Blog | 具身导航的短视距路点预测 | 视觉语言模型…
Jay · 工程筛选报告 · 2026-06-30 下午档
筛选时间:20260630 14:50 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 本次主题:推理引擎 Bug 实证 · 生产 Agent 静默故障 · 2026 推理栈工程对比 · HF Blog 新工具 | # | 条目 | 来源 | 工程价值 | ||||| | 1 | A First Lo…
GitHub Trending 精选 · 2026-06-30 下午档
GitHub Trending 新项目(202606 下半月)/ Agent 基础设施 / 推理优化工具 / 输入压缩 / Agent 可观测性 StartupCorners DevTools Digest 20260606 GitHub Trending AI(ossinsight.io 实时排行) 各项目 GitH…
📋 Jay · 知识库每日简报 · 2026-06-30 下午档
检索时间:20260630 13:35 (Asia/Shanghai) 本次主题:HF Trending 模型 · OWASP Agent 安全 · 推理经济性 · GhostwriterShop · CSDN 边端部署 · QwenRobotNav 检索来源:Tavily (web/search)、HuggingFa…
📋 Jay · 知识库每日简报 · 2026-06-30 上午
检索时间:20260630 11:05 (Asia/Shanghai) 本次主题:向量数据库 · 推理引擎对比 · Agent 评测 · CloudNative AI · A2A/MCP 协议 · SIGMOD 2026 新论文 检索来源:Tavily (web/search)、arXiv、GitHub Trendin…
工程筛选报告 · Jay · 2026-06-30 上午档
生产 LLM Agent 实测研究 / Agent 评测 / Agent 安全 / 上下文工程 arXiv (cs.SE, cs.AI, cs.CY, cs.LG) — 2026 年 6 月近期 ICML 2026 Oral 论文 ASE 2026 安全论文 LangChain State of Agent Engin…
Simon Willison · RSS 摘要
HTML 表格提取器 — 工具:HTML 表格提取器。我持续扩充的粘贴转换工具合集中又添一员。该工具接收从浏览器粘贴的富文本(包含嵌入的 HTML 表格),并进行转换…… 统计 Safari 标签页数量 — 极简 TIL:使用 AppleScript 统计 Safari 中打开的浏览器标签页数量:osascript e…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
VisionDefault, PriorOverride:视觉语言模型中感知知识冲突的因果机制 — 当视觉证据与记忆中的世界知识相冲突时,视觉语言模型必须进行调和。其解决冲突的方式决定了多模态系统的可靠性…… LLM 推理轨迹中的认知片段可实现可解释的人类题目难度预测 — 预测人类题目难度是教育评估的核心,可靠的估计有…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Fast and Feasible:基于排列的约束重排序以实现收益最大化 — 搜索与推荐系统已能产出高度相关的搜索结果。在电商场景中,这类系统发展的自然下一步是对这些结果进行重排序以…… 通过语义块分组对基于嵌入的排序进行列表式解释 — 稠密嵌入排序器通过上下文句子级和段落级表示对文档打分。然而,许多列表式解释方法仍将…
Import AI (Jack Clark) · RSS 摘要
Import AI 463:自我改进机器人;万卡中国 GPU 集群;以及为人本时代谱写的挽歌式随笔 — 我们的过渡期由哪些时代所夹持? Import AI 462:超级说服;自我维持的 AI;通往 ASI 的路径 — 对奇点技术的信仰有多接近宗教? Import AI 461:"对齐研究未步入正轨";FrontierC…
ByteByteGo · RSS 摘要
AI Agent 如何管理记忆并避免遗忘 — 本文将试图理解该架构是如何构建的——从迫使它产生的约束条件,到随之而来的权衡取舍。 EP220:RAG vs Graph RAG vs Agentic RAG — RAG 将 LLM 连接到你的数据,实现方式主要有三种。 服务架构中需要避免的顶级反模式 — 本文将介绍服务架…
AI 工程・GitHub Trending + HuggingFace 每周速览
检索时间:20260630 09:35 (Asia/Shanghai) 检索范围:GitHub 新建项目(20260620)、HuggingFace Trending、AI 工程趋势搜索 本次主题:LLM Agent / RAG / 数据库 / 部署 / 推理优化 | 模型 | 参数量 | 下载量 | 类型 | 亮点 …
CSDN 高价值技术简报 · 2026-06-30 下午 · Jay
CSDN RAG 范式迁移 · 多模态架构 · vLLM/SGLang 推理对比 · MCP 2026 · Agent 开发框架 主检索:CSDN blog.csdn.net × RAG 2026 / 多模态架构 / vLLM SGLang / LangGraph MCP 补充:向量数据库选型、端侧 AI、2026 模…
State of AI Agents 2026 — LangChain 年度行业调查
As we enter 2026, organizations are no longer asking whether to build agents, but rather how to deploy them reliably, efficiently, and at scale. We surveyed 1,3…
Measuring Agents in Production — ICML 2026 Oral
1. 修 调查样本量错误:原版"问卷调查 306 名实践者,26 个领域" → 实为"surveyed 86 deployed systems practitioners across 26 domains"(来自 abstract);"306" 是混淆了 20 case studies × 26 domains 的心…
知识库草稿 · Jay · 2026-06-30
AI 工程·后端·数据库·部署 — 第26周周度研究 1. vLLM vs SGLang vs TensorRTLLM H100 基准对比(2026) 来源:Spheron Network Blog(技术博客,非论文) URL: 核心观点: 三引擎在 H100 80GB + Llama 3.3 70B FP8 下做了一…
LLM Agent Credentials Leaked by Skills — ASE 2026
Thirdparty skills extend LLM agents with powerful capabilities but routinely handle sensitive credentials within privileged execution environments. How these cr…
Context Engineering: From Prompts to Corporate Multi-Agent Architecture
1. 删除原"协议对比"段落中"MCP / A2A / OpenClaw / dark factory"——abstract 一个都没提,"OpenClaw" 是本环境命名被误植进笔记的命名混淆式 hallucination 2. 补 five context quality criteria(relevance / …
知识库草稿 · Jay · 2026-06-30
CSDN 高价值 AI/ML 技术分享 + Substack AI Research Newsletter 精选(本周第 3 次检索) 1. Agent 状态持久化:文档、笔记本、文件集合正在成为长生命周期上下文容器,Agent 可重复操作;这是从"一次生成"到"持续迭代"的关键转变 2. 上下文工程化:瓶颈从模型本身…
Jay · 晚间知识简报 · 2026-06-29 21:30
晚间简报:推理引擎深度对比 · VectorDB 大规模评测 · KubeCon India 2026 AI 采纳率 | GPU | 引擎 | 有效 tok/s | 每 1M token 成本 | ||||| | H100 SXM5 | vLLM (APC off) | 1,850 | $0.61 | | H100 S…
Jay 工程实践筛选 · 2026-06-29 晚间轮(第三次)
推理内核工程 / Agentic 平台架构 / Benchmark 方法论 / LLM 推理框架格局 Day0(202604):~2,200 tok/s/GPU(无 MTP) June 2026(优化后):~11,200 tok/s/GPU(MTP,ISL=8192, OSL=1024) 5x 提升,同等用户延迟 具体…