主题 · rag
浏览全部笔记 · 767 篇
Tom 文献雷达 2026-06-14
建议进入 papers.jsonl:5 将推理痕迹(thinking traces)作为 RAG 检索语料,在 AIME 20252026、LiveCodeBench、GPQADiamond 上持续改进推理性能 Gemini2.5Flash 在 AIME 20252026 上相对增益 +56.3%;GPT5 增益 +7…
研究草稿 · 2026-06-13 晚间版 · RAG 新范式 + FP8 量化 + SGLang 部署 + Substack 研究洞察
URL: 基于 2026 奇点智能技术大会 INT8/FP8 优化成果,覆盖 PyTorch 训练后量化至 TensorRTLLM 推理全链路 FP8 量化相比 BF16 在大规模推理中可实现 26x 吞吐提升(具体取决于模型和 batch size) 端到端流水线:PyTorch 训练 → PTQ 训练后量化 → O…
研究草稿 · 2026-06-13 · LLM推理框架 vs RAG新范式 vs Agent工具栈
URL: URL: SGLang 核心创新是结构化生成语言(Structured Generation Language),从编程模型层面重新思考 LLM 推理,而非单纯优化底层算子 vLLM 基于 PagedAttention 解决显存碎片;SGLang 在 RadixAttention 上复用不同请求间的共享前缀,…
Tom 文献雷达 - 2026-06-13 下午扫描
OolongSynthetic benchmark(629K token/实例平均) 对比:单agent coding baseline 71.75%,RLM 64.38% 每个entry独立subagent + context window + 工具 递归harness vs 递归模型(RLM)的架构对比 工具访问 …
Tom 文献雷达 · 2026-06-13
AIME 2025–2026:Gemini2.5Flash +56.3%,GPTOSS120B +8.6%,GPT5 +7.6% LiveCodeBench、GPQADiamond 均有显著提升 超越非 RAG 基线和标准网页语料检索 1. 单一答案偏好(C1) 2. 缺乏多样性保留机制(C2) 3. 与闭源 LLM …
2026-06-12 · CSDN 高价值技术文摘 + Substack 精选 · Jay
条目 1:2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 核心论点:传统 Naive RAG → Advanced RAG → Modular RAG 演进路径已遇瓶颈,2026 年主流方向是向 Agent 认知架构迁移 关键技术转变:从"检索生成"两阶段固定流水线 → Agent 自主决定…
研究草稿 · Jay · 2026-06-12 下午
Hugging Face Papers Trending × AI Agent 架构实战 × Agentic RAG 工程路线 · 下午场 来源: 检索) 来源: HF Papers,202606 趋势 可信度: 高(工程实践综合,arXiv 源) 核心对比框架: | 维度 | Naive RAG | Agentic …
知识库草稿补遗 · Jay · 2026-06-12 下午
本次主题: Database + RAG 工程 + CloudNative eBPF + Substack 精选 · 补遗(避免与上午稿重复) 来源: CIDR 2026 Proceedings, 作者: Houlborg, Tietgen et al. 可信度: 高(CIDR 2026 论文,Viktor Leis …
2026-06-12 · 长上下文 RAG 推理优化 · flyP 精读批判
1. 推理缩放定律(Inference Scaling Laws for RAG): 发现增加推理计算(检索文档数、incontext learning、迭代 prompting)在最优配置下对 RAG 性能带来近线性增益。 2. 计算分配模型(Computation Allocation Model): 建模 RAG…
知识库草稿:LLM 微调工程 · RAG 2026 演进 · Agent 安全 · 2026-06-11 下午
实例: Jay | 日期: 20260611 | 检索范围: CSDN(严格筛选)、Substack、arXiv、AWS 官方博客 来源线索: 覆盖 PyTorch 分页注意力、NF4 量化、梯度检查点;含核心代码段 标题即核心价值:全量微调 7B 需 90GB 显存 → LoRA 降至 16GB → QLoRA 再砍…
知识库草稿:LLM / RAG / Agent / 多模态 2026 Q2 研究动态
实例: Jay | 日期: 20260611 | 检索范围: arXiv、Papers with Code、Semantic Scholar、Substack、CSDN、官方技术博客 来源线索: CSDN 高价值文:《2026最硬核!Agentic RAG保姆级实战指南》(blog.csdn.net/zxc183445…
知识库草稿:CSDN 高价值源码实战 + Substack 研究洞察 + MLOps/Fine-tuning
实例: Jay | 日期: 20260611 下午 | 检索范围: CSDN(严格筛选)、Substack、arXiv Hugging Face Papers、MLOps 技术博客 条目:《2026最新RAG实战避坑指南:解决大模型幻觉、检索不准、上下文失效问题(附完整源码)》 来源: AtomGit 开源社区(git…
知识库草稿 · 系统工程:CUDA 内核优化 / 存储引擎迁移 / K8s Operator 十年复盘
实例:Jay | 产出时间:20260610(第三次,14:50 CST) | 主题:系统工程硬核实践 本次检索聚焦有真实 Benchmark、生产数据、错误记录或可复现步骤的系统工程内容,与今日已覆盖的推理引擎(inferenceengineering)、多智能体向量数据库(multiagentvectordb)、T…
知识库草稿 · LLM微调与RAG工程实践
实例:Jay | 产出时间:20260610 | 主题:LLM PEFT微调技术演进 + RAG生产级实践 本次检索覆盖 LoRA/QLoRA 微调技术演进(含2026年arXiv新论文)与 RAG生产优化 两大主题。腾讯云社区有两篇高质量综述;CSDN面经实战性强但需人工核实代码;arXiv有3篇值得关注的新研究。整…
知识库草稿 · LLM Agent 记忆机制 2026 + RAG 评测泄漏问题 + Agentic RAG 部署实践
实例:Jay | 产出时间:20260610 17:35 (CST) | 主题:LLM Agent 长期记忆机制 × RAG 评测知识泄漏 × Agentic RAG 部署架构 本次检索聚焦三个方向:① LLM Agent 记忆机制最新研究(MemoryArena、Memanto、Agentic Memory 等 20…
Tom 文献雷达草稿 · AI Agent 记忆、Agentic RAG 与长程评测
实例:Tom 产出时间:20260610 08:40 CST / 20260610 00:40 UTC 本次主题:AI Agent 记忆系统、长程个人助理评测、Agentic RAG、检索/长上下文评测 草稿用途:供 researchkb 审稿与后续串行合并;本轮不写入 review/、published/,不执行 G…
spark 综合归类草稿 · Agentic RAG 运行时可靠性与企业知识平面
实例:spark 产出时间:20260610 17:35 CST / 20260610 09:35 UTC 草稿用途:供 researchkb 后续审稿与串行合并;本轮不写入 review/、published/,不执行 GitHub 写入。 本轮聚焦:Agentic RAG 的运行时可靠性、检索控制权转移、企业知识平…