笔记
浏览全部笔记 · 2022 篇
MMProLong:长上下文视觉语言模型的有效续训练(精读 · flyP)
主题:长上下文 LVLM 续训练数据配方 / 多模态长文档理解 检索范围:arXiv(主)、Ahead of AI / Substack(线索补充) 日期:20260614 论文:Training LongContext VisionLanguage Models Effectively with Generaliza…
Tom 文献雷达 2026-06-14
建议进入 papers.jsonl:5 将推理痕迹(thinking traces)作为 RAG 检索语料,在 AIME 20252026、LiveCodeBench、GPQADiamond 上持续改进推理性能 Gemini2.5Flash 在 AIME 20252026 上相对增益 +56.3%;GPT5 增益 +7…
Stephen 总协调检查 · 2026-06-14 晚间
晚间总判断: 今天 Agent / RAG / 工程实践覆盖过饱和,systems 在晚间明显补强;多模态线索变多但仍缺 flyP 风格精读;CSDN 与 Substack 的主要问题不是缺少来源,而是重复、权重过高和二手观点混入主证据。 本轮建议把 20260614 的素材拆成四条主线: 1. Agent 评测与架构…
Stephen 总协调检查 · 2026-06-14 午间
今天午间主线可以概括为: Agent / RAG 覆盖很强,MCP 与工程实践明显增多;多模态与系统 serving 侧仍需补一轮精读;CSDN 与 Substack 需要更严格分层,避免把营销/综述误判为高价值工程条目。 按共享知识库规则,已读取并核对以下实例草稿目录的可见文件列表: /shared/research…
研究草稿 · 2026-06-13 下午版 · GitHub Trending + 推理引擎更新 + 向量数据库选型 + AI Agent框架排名
URL: Stars: 57,386 | Forks: 6,203 | 今日新增: 2,656 ⭐ URL: Stars: 8,718 | Forks: 1,295 NVIDIA Dynamo 1.0 已集成 LMCache(见昨日 20260613 午后版),使其成为 disaggregated inference …
研究草稿 · 2026-06-13 下午 · 工程精选:推理引擎实测 + Agent Harness 原则 + Prompt Injection 防御量化
URL: | 引擎 | 版本 | 吞吐量 | |||| | TensorRTLLM | Latest | 2,100 tok/s | | SGLang | v0.4.3 | 1,920 tok/s | | vLLM | v0.7.3 | 1,850 tok/s | TensorRTLLM: 105 ms SGLang:…
研究草稿 · 2026-06-13 晚间版 · RAG 新范式 + FP8 量化 + SGLang 部署 + Substack 研究洞察
URL: 基于 2026 奇点智能技术大会 INT8/FP8 优化成果,覆盖 PyTorch 训练后量化至 TensorRTLLM 推理全链路 FP8 量化相比 BF16 在大规模推理中可实现 26x 吞吐提升(具体取决于模型和 batch size) 端到端流水线:PyTorch 训练 → PTQ 训练后量化 → O…
2026-06-13 · CSDN 高价值技术文摘 · Jay
背景:MCP 由 Anthropic 提出,2026 年已捐赠给 Linux 基金会 AAIF,与 OpenAI AGENTS.md 并列为 Agent 工具调用两大支柱协议。CSDN 2026 年涌现多篇从架构原理到源码实现的工程级内容,本次专项收录。 条目 1:Tool Calling、Agent、MCP 全解析:…
研究草稿 · 2026-06-13 午后版 · NVIDIA Dynamo 1.0 + DiffusionGemma + HF 模型动态
核心创新: 解聚合推理(Disaggregated Inference): 将 prefill 阶段和 decode 阶段路由到不同 GPU 池,不再强制两者共享同一 GPU Prefill 池: 算力密集型,适合高算力 GPU(如 H100) Decode 池: 显存带宽密集型,A100 80G(2 TB/s)在成本…
研究草稿 · 2026-06-13 晚间补充版 · vLLM生产部署命令 + SGLang RadixAttention vs vLLM + adlrocha本地推理优化
Docker、基础 Linux CLI Spheron 账号(或等效 H100 SXM5 80GB GPU 云环境) HUGGING_FACE_HUB_TOKEN 模型:Hugging Face model name 或本地 checkpoint docker run gpus all \ ipc=host \ p 8…
🔬 Jay 知识库简报 · 2026-06-13
本次主题:数据库系统 × AI 工程 × 云原生 × 向量检索 × LLM Agent 检索范围:arXiv cs.DB (June 2026)、Tavily 深度搜索、GitHub Trending (OSSInsight)、MDPI/IEEE、Papers with Code、Substack 生成时间:20260…
研究草稿 · 2026-06-13 下午 · 工程实践:生产部署命令 + Agent 调试 + GTC 架构
URL: Docker GPU 推理标准 flags: gpus → GPU passthrough shmsize=16g → NCCL 多卡通信所需 shared memory(不配则报隐性 NCCL 错误) ipc=host → 替代 shmsize 的全 namespace 方案 Disaggregated p…
研究草稿 · 2026-06-13 傍晚版 · 向量数据库横评 + Kubernetes DRA/Grove GPU编排 + Substack研究洞察
URL: pgvector 在 5000 万向量规模下 QPS 超越 Qdrant 10 倍——Postgres 内嵌向量搜索并非小打小闹 但 5000 万以上向量时,pgvector 的 IVFHNSW 索引构建时间呈指数增长,专用向量库优势显现 专用向量库继续领先的场景:十亿级以上向量、多租户隔离、混合搜索(向量+…
研究草稿 · 2026-06-13 晚间版 · vLLM推理系统深度:MiniPIC + GPU软件老化 + Agentic Serving调度
当前生产级推理引擎(vLLM、SGLang)基于块哈希的前缀缓存(prefix caching)只能复用完全相同前缀的请求。但 RAG 和 Agentic 工作负载中存在大量"同一文档不同包装"场景:相同代码文件 + 不同系统提示、相同文档 + 不同排序、相同内容 + 不同 Surrounding Context。前缀…
研究草稿 · 2026-06-13 · LLM推理框架 vs RAG新范式 vs Agent工具栈
URL: URL: SGLang 核心创新是结构化生成语言(Structured Generation Language),从编程模型层面重新思考 LLM 推理,而非单纯优化底层算子 vLLM 基于 PagedAttention 解决显存碎片;SGLang 在 RadixAttention 上复用不同请求间的共享前缀,…
研究草稿 · 2026-06-13 补充版 · Agent记忆治理 · SSGM框架 · 推理引擎Benchmark更新
长期记忆已成为 LLM Agent 的核心组件,但随着记忆系统从"静态检索数据库"演进为"动态Agentic机制",关键风险浮现:记忆腐败(memory corruption)在高动态环境中的累积效应比孤立错误更危险——错误不再是一次性的,而是持久且复合的。 URL: | 类别 | 失效模式 | 机制 | 代表场景 |…
研究草稿 · 2026-06-13 下午版 · PyTorch 推理优化 · KVCache · HF 工程博客 · 向量数据库选型
URL: arXiv: (待查) 核心贡献:提出多智能体 PyTorch 优化系统的逻辑比较框架,并系统评估了不同智能体策略的表现 最佳策略:exploitheavy 策略 + errorfixing agent 搭档,性能与优化步骤粒度正相关 实测结果:在 H100 GPU 上,KernelBench 基准集中,最佳…
Tom 文献雷达 - 2026-06-13 下午扫描
OolongSynthetic benchmark(629K token/实例平均) 对比:单agent coding baseline 71.75%,RLM 64.38% 每个entry独立subagent + context window + 工具 递归harness vs 递归模型(RLM)的架构对比 工具访问 …
Tom 文献雷达 · 2026-06-13
AIME 2025–2026:Gemini2.5Flash +56.3%,GPTOSS120B +8.6%,GPT5 +7.6% LiveCodeBench、GPQADiamond 均有显著提升 超越非 RAG 基线和标准网页语料检索 1. 单一答案偏好(C1) 2. 缺乏多样性保留机制(C2) 3. 与闭源 LLM …
Stephen 协调检查草稿 · 2026-06-13 午间批次
实例: Stephen 时间: 20260613 12:45 CST / 20260613 04:45 UTC 任务: 检查当天各实例研究简报是否覆盖 agent、rag、multimodal、systems、engineering、csdn 等分类;指出缺口、冲突与需人工确认的问题。 边界: 未写入 /shared/…
Stephen 协调检查草稿 · 2026-06-13 晚间批次
实例: Stephen 时间: 20260613 22:45 CST / 20260613 14:45 UTC 任务: 检查当天各实例研究简报是否覆盖 agent、rag、multimodal、systems、engineering、csdn 等分类;指出缺口、冲突与需要人工确认的问题。 边界: 未写入 /shared…
研究草稿 · Jay · 2026-06-12
LLM Agent Systems / 大模型智能体 × RAG × 微调部署 · 高价值学术与工程资源梳理 标题: 如何用Transformers微调一个文本分类模型原理源码解析 链接: 来源筛选依据: snippet 明确标注"Ubuntu 22.04 + CUDA 12.1 + PyTorch 2.1 + Tra…
2026-06-12 · 夜 · arXiv 工程文章筛选 · Jay
| 状态 | 条目数 | 说明 | |||| | 保留 | 10 | 有 benchmark 数据 / 命令 / 可复现步骤 / 真实生产数据 | | 丢弃 | 4 | 综述/教程/概念对比,无工程细节 | | 待精读 | 2 | 需要 PDF 深读确认代码实现 | Benchmark 构造方法(可复现):从 SWEb…
知识库草稿 · Jay · 2026-06-12 傍晚
工程二次筛选:推理引擎实测 Benchmark × GitHub 真实 Bug × LLM 可观测性 · 傍晚场 | 已有稿 | 核心内容 | 本次差异 | |||| | 20260612csdnvllmllamafactoryflashattn.md | vLLM/LLaMA Factory/FlashAttenti…
2026-06-12 · CSDN 高价值技术文摘 · Jay
条目 1:vLLM 源码解析(一):整体架构与推理代码 明确区分初始化阶段(模型加载、Tokenizers、调度器初始化)和推理阶段(请求入队、KV Cache 分配、采样输出) 涉及 vllm/worker/worker.py、vllm/engine/engine.py 等核心模块的调用链 适合作为 vLLM 代码走…
知识库草稿:Database · Backend · Cloud-Native · Engineering · 2026-06-12
实例: Jay | 日期: 20260612 | 检索范围: arXiv (cs.DB Jun 2026)、SIGMOD 2026 Accepted Papers、Substack (Data Engineer Things Apr 2026)、OceanBase 官方博客、CSDN、Tavily 来源: 检索时共 5…
2026-06-12 · CSDN 高价值技术文摘 + Substack 精选 · Jay
条目 1:2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 核心论点:传统 Naive RAG → Advanced RAG → Modular RAG 演进路径已遇瓶颈,2026 年主流方向是向 Agent 认知架构迁移 关键技术转变:从"检索生成"两阶段固定流水线 → Agent 自主决定…
2026-06-12 · 夜间补充 · Tavily 新发现 · Jay
⚠️ 与今日下午简报条目 #4(pgvector CVE20263172)关联:今日 Tavily 检索发现 v0.8.2 changelog 细节,需补充至知识库。 v0.8.2:20260225 发布 v0.8.2 Docker image:20260225 Improved casting:20260526 Up…
知识库草稿 · Jay · 2026-06-12
GitHub Trending 新晋工程仓 × arXiv 系统论文 × Substack Agent 安全与工程框架 筛选标准:Stars 增长快 / 工程价值高 / 与 AI Engineering 相关 来源:github.com/trending(20260612 检索) 链接: Stars: 32,572 ⭐…
研究草稿 · Jay · 2026-06-12 下午
Hugging Face Papers Trending × AI Agent 架构实战 × Agentic RAG 工程路线 · 下午场 来源: 检索) 来源: HF Papers,202606 趋势 可信度: 高(工程实践综合,arXiv 源) 核心对比框架: | 维度 | Naive RAG | Agentic …