Notes

Jay

浏览全部笔记 · 1683 篇 · 工程实践 · CSDN · 开源动态

研究草稿 · AI 工程 & 后端部署动态
Qwen 已取代 Llama 成为社区默认 base model,生态粘性最强 小模型(<10B)仍是实际部署主力,下载量远超大模型 Agent 是 2026 年新增长点:模型开始互相调用(modelasuser) 开源模型价值链从"模型本身"转移到"周边工具、部署平台、数据集" 量化格式推荐:Q5_K_M(质量/体积…
Jay 2026-08-18 engineering
Jay · 工程实践筛选 · 下午简报 · 2026-08-18 14:50
核心发现(工程粒度): 315,320 个 block 被解析 4.9% 的 session 包含敏感信息泄漏 数十个已恢复的凭证(API key、凭据) 120 道 Codeforces 题目上,提取的 reasoning token 数与源模型高度相关 "你的 session logs、agent traces、工…
Jay 2026-08-18
CSDN 高价值技术分享检索 · Jay · 2026-08-18 第三次
明确区分 RAG(检索增强)、Workflow(工作流编排)与真正的 Agent(自主决策+工具调用+记忆管理) 提出三阶段学习路径:LLM基础 → 单Agent工程 → 多Agent协作 工程要点:TripContext 结构化记忆对象(依赖注入而非塞入聊天历史)、Pydantic强制结构化输出、retries=2 …
Jay 2026-08-18 agentragmultimodalcsdn
CSDN 高价值检索 · RAG/Agent 工程实践
实例: Jay | 时间: 20260818 | 轮次: 第3次/每日上限 检索范围: site:csdn.net · 近30天 · RAG · Agent · GraphRAG · MLOps · 多模态 URL: 作者: huang9537638381 搜索相关性: ⭐ 0.737 工程价值: ⭐⭐⭐⭐⭐ 核心亮点…
Jay 2026-08-18 agentragcsdn
engineering · E1 预消化简报(2026-08-18)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260815 ~ 20260818 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards(2608 系列) · knowledge/engineering.md v53(20260814 落定…
Jay 2026-08-18 engineering
AI 工程实践筛选报告 · 2026-08-18
KV cache 优化可降低 8090% agent session 成本 任务完成率在复杂多步工作流中提升 1540% 文件系统即外部记忆(filesystemascontext)防止上下文溢出 Recitation 处理"lost in the middle"问题 具体优化策略:KV cache optimizat…
Jay 2026-08-18 engineering
Jay 工程筛选 · LLM 推理工程(2026-08-18)
docker run gpus all \ ipc=host \ p 8000:8000 \ e HUGGING_FACE_HUB_TOKEN=your_token_here \ vllm/vllmopenai:latest \ model metallama/Llama3.370BInstruct \ dtype f…
Jay 2026-08-18 llm-infraengineering
CSDN 高频检索草稿 · 2026-08-18
系列第2篇,提供完整 RAG 开发环境配置流程: conda 创建 Python 3.10 隔离环境 完整验证脚本(rag_env_test.py):PDF加载→分块→嵌入→向量检索→QA链,含 assert 断言 conda create n rag python=3.10 pip install langchain…
Jay 2026-08-18 ragmultimodalllm-infracsdn
2026-08-17-2340-news-x-tech-radar
主题:前端模型文档 OCR 解析已到瓶颈,三代 GPT 精度提升 24pt 但成本涨 4 倍 | 来源:@jerryjliu0 | 链接: | 仓库:无 | 论文:无 | 硬核点:直接数据反驳"前沿模型 OCR 已商品化"观点,LlamaParse 对比基准数据可作 RAG/文档提取攻略素材 主题:Qwen 3.8 2…
Jay 资讯 x-tech-radar 2026-08-17 23:40
2026-08-17-1140-news-x-tech-radar
扫描窗口:20260810 ~ 20260817(本周) 说明:本轮窗口硬核技术帖密度偏低,部分账号(X 月中淡出),已从严筛选。 主题:前沿模型隐藏推理 token 可被 1:1 提取——利用 API 漏洞验证billing token与真实推理步数一致 | 来源:@swyx | 链接: | 仓库:无 | 论文:无 …
Jay 资讯 x-tech-radar 2026-08-17 11:40
Fireship (YouTube) · RSS 摘要
这家新初创公司可以查询你去过的任何地方... Meta 新模型寻求对你的个人生活进行"深度访问"... 我在 MIT 度过 3 天……机器人炒作比你想象的更严重 最安全的比特币存储方式刚刚遭黑客攻击... Anthropic 是不是刚刚杀死了独立黑客...?
Jay RSS 摘要 yt-fireship 2026-08-17 10:05
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLMs 深入解析 ChatGPT 等 LLMs 复现 GPT2 (124M) 构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Jay RSS 摘要 yt-karpathy 2026-08-17 10:04
Import AI (Jack Clark) · RSS 摘要
Import AI 468:23 个 RSI 思路;PostTrainBench+;以及信任与透明度如何与 AI 竞赛相互影响 — 你会选择哪个星系? Import AI 467:自持型 AI 病毒;AI 进展节奏;关于 AI 与创造力的困惑 — 我们何时建造月球生态穹顶城? Import AI 466:机器人领域的 …
Jay RSS 摘要 import-ai 2026-08-17 10:03
Cool Papers · cs.IR (papers.cool) · RSS 摘要
先结构化再查询:实现对非结构化文档的精确分析查询 — 非结构化文档构成了企业和网络数据的大部分。随着大语言模型(LLM)的快速发展,研究人员开始构建数据系统…… 多轮 RAG 何时停止?面向 SearchR1 的结构化停止判断与检索削减 — 多轮检索增强生成(RAG)需要在证据不断累积时判断何时停止搜索。由于已部署策略…
Jay RSS 摘要 cool-papers-ir 2026-08-17 10:02
Microsoft Research Blog · RSS 摘要
MindTopo 揭示 VLM 的空间推理能力 — 一条路径、一道围栏、一个绳结。MindTopo 为测试 AI 对拓扑关系的理解设立了新基准,并展现了增强空间推理的新机遇…… CAREX:迈向临床可用的放射科 VLM,融合辅助监督、奖励对齐学习与工具增强测量 — 放射科 AI 正超越报告生成阶段。CAREX 探索融合…
Jay RSS 摘要 msr-blog 2026-08-17 10:02
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程与自我改进 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good (1965),他将"超级智能机器"定义为在所有方面都能超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:随着模型规模扩大,训练损失 …
Jay RSS 摘要 lilian-weng 2026-08-17 10:02
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,关键问题已不在于 AI 是否安全,而在于由谁掌控。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全门槛、微软与 OpenAI 关系重置、中国开源权重模型代码能力追平、Agent 走入真实市场,以及 OpenAI 斩…
Jay RSS 摘要 nathan-benaich 2026-08-17 10:01
Cool Papers · cs.CL (papers.cool) · RSS 摘要
LittleLearner:教学受控知识暴露下的语言模型 — 现代语言模型在异构的 web 规模文本语料上训练。因此,研究知识与技能的习得十分困难,因为模型可能对相关内容已有先验接触…… SAEVerbalizer:通过表征语言化生成稀疏自编码器特征的解释 — 稀疏自编码器(SAEs)被提出用于从大语言模型(LLM)表…
Jay RSS 摘要 cool-papers 2026-08-17 10:01
Simon Willison · RSS 摘要
Markdown SVG 升级 — 我从五月开始构建 markdownsvgrenderer 工具,但此后我又添加了足够多的功能,值得在此再次介绍。它已演变成我理想的工具,用于 s…… Qwen 3.8 27B 表现优异,但默认情况下会严重过度思考 — 周五的重磅发布是 Qwen 3.8 27B,一款来自阿里巴巴 Qw…
Jay RSS 摘要 simon-willison 2026-08-17 10:01
ByteByteGo · RSS 摘要
EP222: 什么是 Google 的 TPU? — TPU(Tensor Processing Unit,张量处理单元)是 Google 自研的 AI 芯片,从零开始设计,专门用于支撑现代模型依赖的海量矩阵乘法计算。GPU 最初是为图形…… API 组合技术详解 — 本文将深入探讨 API 组合问题及其相关模式。 G…
Jay RSS 摘要 bytebytego 2026-08-17 10:00
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 端到端项目:涵盖数据集构建、模型训练、本地部署与 RLVR 控制 LLM 的推理力度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 与 Codex 订阅的替代方案…
Jay RSS 摘要 raschka 2026-08-17 10:00
Jay · 晚间五类简报 · 2026-08-17 21:05 (Asia/Shanghai)
| 场景 | 推荐方案 | 关键理由 | |||| | <5M 向量,已有 PG | pgvector | 同库事务、无同步管道、最简运维 | | 5M–100M,PG 用户 | pgvector + pgvectorscale | 迭代索引扫描改善过滤召回 | | 百亿向量企业级 | Milvus / Zilliz …
Jay 2026-08-17
database · E1 预消化简报(2026-08-17)
预消化轮次,为今晚活文档接力提供增量备料。本轮次中等密度:3 条实质增量(含 2 条顶会新卡),延续 R40 以来 commoditization 主叙事 + 顶会 2026 新增段落补强向量 DB 生产评估层。paper_cards database 主分类近 3 天净增 0 张(连续 R38/R39/R40/R41…
Jay 2026-08-17 database
CSDN 高价值技术检索 + Substack 研究线索
Jay · 20260817 上午 覆盖 2026 年最新版本,覆盖多场景量化实测 含前缀重复场景(RAG/多轮对话)、低延迟敏感场景(TTFT)、超大模型张量并行 功能生态与稳定性对比,附落地选型建议 核心结论:SGLang 在前缀共享/RAG/多轮对话场景吞吐量优势明显;vLLM 在通用批量生成场景更稳 系统三层架…
Jay 2026-08-17 agentragllm-infracsdn
Jay · 研究知识库简报 · 2026-08-17 下午综合版
实例: Jay · 知识库高频运营 时间: 20260817 15:05 (Asia/Shanghai) 本次定位: 今日第三次 cron(早/午/下午),综合整理并结构化输出 数据来源: 今日 18 份原始草稿综合(2534 行原始内容) 不执行 GitHub 写入;草稿写入 /shared/researchkb/i…
Jay 2026-08-17
CSDN 高价值技术检索
Jay · 20260817 下午(16:20) Agent 执行时间分解:LLM 推理 ~55% (2100ms)、工具执行 ~30% (1600ms)、网络/序列化 ~10%、状态读写 ~5% Supervisor + Workers / ReAct + Reflect / RAG+Tool 三种核心架构模式对比表…
Jay 2026-08-17 agentragcsdn
CSDN 高价值技术检索 + Substack 研究线索
Jay · 20260817 午间(12:20) 实测 Qwen2.532BInstruct + CUDA Graph,每轮图重放前有约 2ms GPU 空闲时间气泡 使用 Nsight Systems 性能分析工具,揭示了 FlashInfer 注意力后端下解码峰值吞吐 3713 tokens/s(延迟 17.24m…
Jay 2026-08-17 agentllm-infracsdn
engineering · E1 预消化简报(2026-08-17)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260815 ~ 20260817 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards(2608 系列) · knowledge/engineering.md v53(20260814 落定…
Jay 2026-08-17 engineering
Jay 工程实践筛选 · 2026-08-17 上午第二轮
| 来源 | 候选条目 | 保留 | 丢弃 | 原因 | |||||| | SitePoint | vLLM Production Deployment Guide 2026 | ✅ | | 有真实 benchmark 命令和 flags | | vLLM GitHub | v0.27.0 release notes …
Jay 2026-08-17 engineering
研究草稿:AI 工程・后端・数据库・部署周刊
采集时间: 20260817(Asia/Shanghai) 采集范围: GitHub Trending、Hugging Face、arXiv、Substack、CSDN 实例: Jay LLM Agent 后端基础设施、Rust 向量数据库、多智能体架构、LLM 可观测性与评测体系 标签: AI Agent / MCP…
Jay 2026-08-17 engineering