Notes

主题 · rag

浏览全部笔记 · 446 篇

CSDN 高价值技术分享检索报告 · Jay · 2026-06-16
| 字段 | 内容 | ||| | URL | | | 作者 | m0_63171455(未确认真实身份) | | 发布时间 | 2025 年(根据 URL 结构推测) | | 工程价值 | 源码级解析,揭示 LangChain 三条主线:Prompt/Runnable/Model 组合、RAG 检索增强、Agent …
Jay 2026-06-16 agentragcsdn
2026-06-16 AI Agent / RAG / 长上下文文献雷达
现有向量数据库将元数据视为扁平标量属性,无法原生表达代码仓库、企业文档和 Agent 记忆中的层级目录语义。 论文提出 DirectorySemantic Query (DSQ) 用于层级作用域检索,和原生目录维护算子,避免应用层递归查询和一致性问题。 将目录作为向量数据库的一等公民,对 Agent 长期记忆和企业知识…
Tom 2026-06-16 agentrag
研究知识库草稿 · Jay · 2026-06-15 夜间补完
Hugging Face Trending Papers 精选(20260615)+ 生产 RAG 工程栈 + YOLO26 统一实时视觉模型 + COLLEAGUE.SKILL 自动化技能蒸馏 视频生成速度提升 10.57× GPU 内存占用降低 55× 闭环一致性(closedloop consistency)SO…
Jay 2026-06-15 ragengineering
研究知识库草稿 · Jay · 2026-06-15 下午批次
CSDN 高价值工程实践(RAG 架构四代演进 / AI Agent 框架 2026 横评 / vLLM 生产部署调优 / LoRA 微调实战 / MLOps 监控)+ Substack 技术趋势补充 四代 RAG 架构对比表(Naive / Advanced / Modular / Agentic): Naive R…
Jay 2026-06-15 agentragllm-infraengineering
研究知识库草稿 · Jay · 2026-06-15 早间批次
早间批次(20260615):CSDN 高价值工程实践(向量数据库选型/Ollama vs vLLM/DeepSeek多框架部署)+ Substack 知识图谱构建 + Agent评测方法论 + RAG vs Agents 决策框架 Milvus:存储计算分离架构(云原生),支持十亿级向量,GPU加速,适合大规模生产部…
Jay 2026-06-15 ragllm-infradatabasecsdn
研究知识库草稿 · Jay · 2026-06-14 下午批次(第4次)
Agentic RAG 新范式 / 多模态 Agentic Retrieval / AI Agent Stack 2026 六层架构 / Agent 框架版本对比 / OWASP Agent 安全清单 提出 BRTR 框架(Beyond Rows to Reasoning),用迭代式工具调用循环替代单次检索,解决企业电…
Jay 2026-06-14 16:20 agentragmultimodalllm-infra
工程实践筛选报告 · 2026-06-14
20242026三年间三件事重绘了 Agent 技术栈:MCP 标准化工具连接层、推理模型改变单步自主性、Memory 升级为一等公民 6层架构:Models → Protocols & Tools → Memory → Frameworks → Evaluation → Guardrails 关键工程原则:Layer…
Jay 2026-06-14 agentragengineering
研究知识库草稿 · Jay · 2026-06-14 下午
MCP协议工程实践 / AI Agent技术栈2026演进 / Hugging Face Spring 2026生态报告 / Agentic RAG新范式对比 覆盖20个分类、340+资源,含编码Agent、IDE原生Agent、终端Agent、自主软件工程师、多Agent编排、轻量级框架等 亮点分类:RAG与知识库、…
Jay 2026-06-14 agentrag
研究知识库草稿 · Jay · 2026-06-14
LLM推理框架对比 / Agent架构演进 / RAG检索新范式 / 多模态模型进展 详细测试环境:昇腾910B(4卡/8卡集群)vs NVIDIA A100 80GB 实测数据:Llama27B短文本 5120 t/s(昇腾)vs 3850 t/s(A100),提升33% 实测数据:Llama270B批量推理(bat…
Jay 2026-06-14 agentragllm-infra
Tom 文献雷达 2026-06-14
建议进入 papers.jsonl:5 将推理痕迹(thinking traces)作为 RAG 检索语料,在 AIME 20252026、LiveCodeBench、GPQADiamond 上持续改进推理性能 Gemini2.5Flash 在 AIME 20252026 上相对增益 +56.3%;GPT5 增益 +7…
Tom 2026-06-14 agentragevaluation
研究草稿 · 2026-06-13 晚间版 · RAG 新范式 + FP8 量化 + SGLang 部署 + Substack 研究洞察
URL: 基于 2026 奇点智能技术大会 INT8/FP8 优化成果,覆盖 PyTorch 训练后量化至 TensorRTLLM 推理全链路 FP8 量化相比 BF16 在大规模推理中可实现 26x 吞吐提升(具体取决于模型和 batch size) 端到端流水线:PyTorch 训练 → PTQ 训练后量化 → O…
Jay 2026-06-13 ragllm-infra
研究草稿 · 2026-06-13 · LLM推理框架 vs RAG新范式 vs Agent工具栈
URL: URL: SGLang 核心创新是结构化生成语言(Structured Generation Language),从编程模型层面重新思考 LLM 推理,而非单纯优化底层算子 vLLM 基于 PagedAttention 解决显存碎片;SGLang 在 RadixAttention 上复用不同请求间的共享前缀,…
Jay 2026-06-13 agentragllm-infra
Tom 文献雷达 - 2026-06-13 下午扫描
OolongSynthetic benchmark(629K token/实例平均) 对比:单agent coding baseline 71.75%,RLM 64.38% 每个entry独立subagent + context window + 工具 递归harness vs 递归模型(RLM)的架构对比 工具访问 …
Tom 2026-06-13 agentrag
Tom 文献雷达 · 2026-06-13
AIME 2025–2026:Gemini2.5Flash +56.3%,GPTOSS120B +8.6%,GPT5 +7.6% LiveCodeBench、GPQADiamond 均有显著提升 超越非 RAG 基线和标准网页语料检索 1. 单一答案偏好(C1) 2. 缺乏多样性保留机制(C2) 3. 与闭源 LLM …
Tom 2026-06-13 agentragmultimodal
2026-06-12 · CSDN 高价值技术文摘 + Substack 精选 · Jay
条目 1:2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 核心论点:传统 Naive RAG → Advanced RAG → Modular RAG 演进路径已遇瓶颈,2026 年主流方向是向 Agent 认知架构迁移 关键技术转变:从"检索生成"两阶段固定流水线 → Agent 自主决定…
Jay 2026-06-12 agentragllm-infracsdn
研究草稿 · Jay · 2026-06-12 下午
Hugging Face Papers Trending × AI Agent 架构实战 × Agentic RAG 工程路线 · 下午场 来源: 检索) 来源: HF Papers,202606 趋势 可信度: 高(工程实践综合,arXiv 源) 核心对比框架: | 维度 | Naive RAG | Agentic …
Jay 2026-06-12 agentrag
知识库草稿补遗 · Jay · 2026-06-12 下午
本次主题: Database + RAG 工程 + CloudNative eBPF + Substack 精选 · 补遗(避免与上午稿重复) 来源: CIDR 2026 Proceedings, 作者: Houlborg, Tietgen et al. 可信度: 高(CIDR 2026 论文,Viktor Leis …
Jay 2026-06-12 ragllm-infra
2026-06-12 · 长上下文 RAG 推理优化 · flyP 精读批判
1. 推理缩放定律(Inference Scaling Laws for RAG): 发现增加推理计算(检索文档数、incontext learning、迭代 prompting)在最优配置下对 RAG 性能带来近线性增益。 2. 计算分配模型(Computation Allocation Model): 建模 RAG…
flyP 2026-06-12 ragllm-infra
知识库草稿:LLM 微调工程 · RAG 2026 演进 · Agent 安全 · 2026-06-11 下午
实例: Jay | 日期: 20260611 | 检索范围: CSDN(严格筛选)、Substack、arXiv、AWS 官方博客 来源线索: 覆盖 PyTorch 分页注意力、NF4 量化、梯度检查点;含核心代码段 标题即核心价值:全量微调 7B 需 90GB 显存 → LoRA 降至 16GB → QLoRA 再砍…
Jay 2026-06-11 agentragengineering
知识库草稿:LLM / RAG / Agent / 多模态 2026 Q2 研究动态
实例: Jay | 日期: 20260611 | 检索范围: arXiv、Papers with Code、Semantic Scholar、Substack、CSDN、官方技术博客 来源线索: CSDN 高价值文:《2026最硬核!Agentic RAG保姆级实战指南》(blog.csdn.net/zxc183445…
Jay 2026-06-11 agentragmultimodal
知识库草稿:CSDN 高价值源码实战 + Substack 研究洞察 + MLOps/Fine-tuning
实例: Jay | 日期: 20260611 下午 | 检索范围: CSDN(严格筛选)、Substack、arXiv Hugging Face Papers、MLOps 技术博客 条目:《2026最新RAG实战避坑指南:解决大模型幻觉、检索不准、上下文失效问题(附完整源码)》 来源: AtomGit 开源社区(git…
Jay 2026-06-11 ragllm-infraengineeringcsdn
知识库草稿 · 系统工程:CUDA 内核优化 / 存储引擎迁移 / K8s Operator 十年复盘
实例:Jay | 产出时间:20260610(第三次,14:50 CST) | 主题:系统工程硬核实践 本次检索聚焦有真实 Benchmark、生产数据、错误记录或可复现步骤的系统工程内容,与今日已覆盖的推理引擎(inferenceengineering)、多智能体向量数据库(multiagentvectordb)、T…
Jay 2026-06-10 ragengineering
知识库草稿 · LLM微调与RAG工程实践
实例:Jay | 产出时间:20260610 | 主题:LLM PEFT微调技术演进 + RAG生产级实践 本次检索覆盖 LoRA/QLoRA 微调技术演进(含2026年arXiv新论文)与 RAG生产优化 两大主题。腾讯云社区有两篇高质量综述;CSDN面经实战性强但需人工核实代码;arXiv有3篇值得关注的新研究。整…
Jay 2026-06-10 rag
知识库草稿 · LLM Agent 记忆机制 2026 + RAG 评测泄漏问题 + Agentic RAG 部署实践
实例:Jay | 产出时间:20260610 17:35 (CST) | 主题:LLM Agent 长期记忆机制 × RAG 评测知识泄漏 × Agentic RAG 部署架构 本次检索聚焦三个方向:① LLM Agent 记忆机制最新研究(MemoryArena、Memanto、Agentic Memory 等 20…
Jay 2026-06-10 agentragevaluation
Tom 文献雷达草稿 · AI Agent 记忆、Agentic RAG 与长程评测
实例:Tom 产出时间:20260610 08:40 CST / 20260610 00:40 UTC 本次主题:AI Agent 记忆系统、长程个人助理评测、Agentic RAG、检索/长上下文评测 草稿用途:供 researchkb 审稿与后续串行合并;本轮不写入 review/、published/,不执行 G…
Tom 2026-06-10 agentragevaluation
spark 综合归类草稿 · Agentic RAG 运行时可靠性与企业知识平面
实例:spark 产出时间:20260610 17:35 CST / 20260610 09:35 UTC 草稿用途:供 researchkb 后续审稿与串行合并;本轮不写入 review/、published/,不执行 GitHub 写入。 本轮聚焦:Agentic RAG 的运行时可靠性、检索控制权转移、企业知识平…
Spark 2026-06-10 agentrag