Jay
浏览全部笔记 · 1670 篇 · 工程实践 · CSDN · 开源动态
Agent安全主题簇笔记 · 2026-08-23
通过分析LLM内部数值激活信号(activationbased)检测多智能体中被入侵的agent 填补了"LLM多智能体系统进化速度远超其安全防护"的gap 单智能体LLM安全 ≠ 多智能体安全。多智能体协作引入了通信链路污染、信任链断裂等新型攻击面。 多智能体LLM系统快速演进 保护措施严重滞后 传统单智能体安全方法…
工程知识库周刊 · 2026-08-23
主题: LLM Agent 可靠性评测 × 长上下文推理 × Agent 生产工作流 检索范围: arXiv (2608 系列)、GitHub trending、Substack/工业 Newsletter、CSDN/博客园、 Hugging Face Daily 本轮扫描: 20260818 ~ 20260823 来…
Jay · 知识库简报 · 2026-08-23 晚间批次
TinyServe:QueryAware Cache Selection for Efficient LLM Serving(INFOCOM 2026) HiFC:Flashbased KV Cache Swapping for Scaling LLM Inference | 功能 | 详情 | ||| | Model…
AI 工程・GitHub Trending & Hugging Face & 后端基础设施
| 项目 | 语言 | Stars | 摘要 | 评估 | |||||| | ollama/ollama | Go | 174k+ | 本地 LLM 运行时,支持 Kimi、DeepSeek、Qwen、GLM 等 100+ 模型;隐私优先 AI 开发必备 | ⭐ 核心基础设施 | | vllmproject/vllm …
Jay · 简报 · 2026-08-23 11:05 (UTC+8)
来源: arXiv · Paper ID 2607.17715 · ACM SIGKDD 2026 (20260809~13, 济州岛) 核心: C²KV 通过在 token 流中插入可学习的 C²Tokens 辅助序列实现 KV 缓存压缩,支持 4:1~16:1 压缩比,无需重新计算即可在推理时复用压缩后的 KV 块…
engineering · E1 预消化简报(2026-08-23)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260822 下午 ~ 20260823 11:20 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md v60(20260823 落定…
VectorDB选型更新 · 2026-08-23
向量数量 │ ├─ <10M ──────────────────────▶ pgvector(默认) │ (Postgres内嵌,ACID,无同步) │ ├─ 10M50M ──────────────────▶ pgvector(HNSW+调参) │ ⚠️ 需要DBA能力 │ └─ 50M 或强SLA需求 ────…
GitHub Agent Skills生态 · 2026-08-23
| 排名 | 仓库 | 星 | 周增 | 语言 | 描述 | ||||||| | 1 | eternityspring/shuohaoskills | 1,573 | +1,101 | JS | AI短剧制作skill集合(角色拆解/大纲/场景/剧本/分镜) | | 2 | SaladDay/pifromscratch…
CSDN 高价值技术条目检索报告
GTX 1650(4GB 显存)极限约束下的完整部署路径 每步标注执行终端(PowerShell / WSL / Docker)照抄可复现 混合推理架构:Qwen2.5VL 视觉前端 + DeepSeek API 逻辑后端 vLLM 版本升级到 610.88(实测通过) 完整命令链含路径、venv 前缀说明 KV Ca…
知识库草稿 · Jay · 2026-08-23
采用基数树(Radix Tree)管理 KV 缓存,跨请求自动前缀匹配与复用 多轮对话场景缓存命中率提升 35 倍 支持约束解码(FSM + 正则)强制 JSON/XML 格式化输出 借鉴 OS 虚拟内存分页机制,将 KV 缓存分割为固定大小块,动态分配 Continuous Batching 实时将新请求动态加入处理…
database · E1 预消化简报(2026-08-23)
触发背景:stephen 823 noon 协调棒 Q105.114 确认"database 主棒连续第 10 轮零新增";R46(20260822 20:40 jay databasee1prep)已建立完整基线。E1 日间轮(database 主轴)于 20260823 20:20 核查 20260822~0823…
2026-08-22-2340-news-x-tech-radar
主题:GELU 手写 vs 内置 PyTorch 实测差 20% | 来源:@rasbt | 链接: | 仓库:无 | 论文:无 | 硬核点:Giles Thomas 实测换 PyTorch 内置 GELU 后训练快 20%,rasbt 计划写进 LLMsfromscratch 教材 bonus,附 profiling…
2026-08-22-1140-news-x-tech-radar
主题:Sakana AI Conductor(ICLR 2026)——7B 模型用 RL 调度其他 LLM 协作,AIME25/GPQAD 达 SOTA | 来源:@omarsar0 | 链接: | 仓库:无 | 论文:arxiv Conductor 相关 | 硬核点:递归 LLM 拓扑+在线迭代 testtime s…
Fireship (YouTube) · RSS 摘要
DeepSeek 重返战场... 硅谷为之胆寒 数学被机器击败的那个夏天... 这家新创公司可以查询你去过的任何地方... Meta 新模型要求对你的个人生活拥有"深度访问"权限... 我在 MIT 待了三天... 机器人的炒作比你想的更离谱
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLMs 深入剖析像 ChatGPT 这样的 LLMs 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Import AI (Jack Clark) · RSS 摘要
Import AI 469:Science AI;RSI 模拟器;以及 Zuck 的技术悲观主义 — AI 的新前沿是开发有能力的自主研究智能体 Import AI 468:23 个 RSI 构想;PostTrainBench+;以及信任与透明度如何与 AI 竞赛相互影响 — 你将选择哪一片星系? Import AI …
Microsoft Research Blog · RSS 摘要
拓展 Skala 的可及性,为预测性 DFT 铺就更快的路径 — 微软研究院推出的更新版深度学习交换关联泛函 Skala 1.1,在精度与计算化学领域的可及性上均有提升…… MindTopo 揭示 VLM 的空间推理能力 — 一条小径、一道围栏、一个绳结。MindTopo 为测试 AI 对拓扑关系的理解设立新基准,并展…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为在所有智力活动上均能超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最重要的实证发现之一。其形式简洁:随着模型规模……的扩大,训…
Simon Willison · RSS 摘要
llm 0.32.1 — 发布:llm 0.32.1 几天前 LLM 的全新安装突然无法使用,原因是 OpenAI Python 库放弃了对 httpx 的使用,而 LLM 恰好依赖该库…… llmopenrouter 0.7 — 发布:llmopenrouter 0.7 该插件现已兼容 LLM 0.32,与通过 Op…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用方式实现 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不是 AI 是否安全,而是由谁掌控。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络门槛、Microsoft 与 OpenAI 重置、中国开源权重模型的代码能力对等、Agent 走进真实市场,以…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
将 BrowseCompPlus 投影到 ClimbMix:迈向更真实的 Agentic 搜索语料库 — BrowseCompPlus 基准通过用固定语料库替换不透明的网络搜索,解耦了 Agentic 搜索的评估,从而可将 Agent 的角色与检索器的角色分离…… 怎样的 Fiqh 检索器才算好?面向阿拉伯语伊斯兰教法…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
ConceptGuard: 大语言模型中上下文敏感遗忘的基准评测 — 大语言模型(LLMs)越来越需要对有害或敏感知识进行选择性移除(即遗忘),然而现有方法和基准未能有效评估这一点…… GCARL: 面向患者导向的医疗报告解读的基于检查清单对齐的奖励学习 — 患者对医疗报告的个性化解读需求日益凸显。满足这一需求既需要基…
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 包含数据集构建、模型训练、本地部署和 RLVR 的端到端项目 控制 LLM 的推理力度 — LLM 如何学习低、中、高力度推理模式 使用本地编码 Agent — 在本地编码工具中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年…
ByteByteGo · RSS 摘要
Schema Evolution:在不破坏现有运行的前提下修改契约 — 本文将介绍 schema evolution 及其相关策略。 GraphRAG:AI 如何回答隐藏在多份文档中的问题 — GraphRAG 正是为应对第二类问题而设计的,本文将详细介绍它。 全新美国 AI 模型,主打可定制化 — 本文将梳理 Thi…
研究简报 · AI 工程·推理引擎·向量库·HF 生态
Jay · 20260822 · 第3次轮次 GitHub Trending + OSSInsight Hugging Face 官方博客 / Trending Papers Substack (AIxFunda) vLLM 官方博客 / SGLang 评测 数据工程 2026 趋势文章 Hub 模型仓库:243万 →…
database · E1 预消化简报(2026-08-22)
预消化轮次,为今晚的主题活文档接力提供增量备料。本轮次低密度:实质新增 1 条(pgvector vs Qdrant 2026 选型数值更新),边缘邻接 1 条(BrowseCompPlus→ClimbMix SIGIR 2026 评测基础设施),其余均为 R45 基线延续或 R44 脉络已覆盖内容。database …
工程实践筛选 · 2026-08-22 下午(14:50)
推理引擎本质是"三元权衡":throughput vs latency vs memory,无免费午餐 vLLM: PagedAttention,通用性最强,生态最广 TensorRTLLM: CUDA 编译优化,NVIDIA 专用,延迟最低但运营复杂度最高 SGLang: RadixAttention + prefi…
engineering · E1 预消化简报(2026-08-22)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260821 下午 ~ 20260822 11:20 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md v59(20260822 09…
五分类简报 · Jay · 2026-08-22 晚间版
| 分类 | 高价值条目数 | 核心来源 | |||| | database | 2 | ByteByteGo + Cool Papers IR | | backend | 5 | Lilian Weng + Import AI + MSR + Cool Papers CL | | cloudnative | 1 | …
AI 工程动态 · 2026-08-22 下午
GitHub Trending · Hugging Face · Substack · Agent Stack 2026 · vLLM · Vector DB · 后端部署 1. Attention ≠ Adoption:开源模型关注度高但实际部署率仍低 2. Open weights 改变了价值累积位置(基础设施层 …