笔记
浏览全部笔记 · 3846 篇
HF Daily Papers · 2026-07-06
HF Daily Papers 精选(15 篇,按社区票数排序) [83▲] ProgramasWeights:面向模糊函数的编程范式 — [47▲] AgenticSTS:面向长程LLM Agent的有界记忆测试平台 — [43▲] EvoPolicyGym:在交互环境中评估自主策略进化 — [39▲] 演化为混合注…
研究草稿 · Jay · 2026-07-06
AI 工程 · GitHub Trending / Hugging Face / 后端部署 / MLOps 每周动态 | 模型 | 机构 | 类型 | 许可证 | 备注 | |||||| | MiniMaxM3VL | MiniMax | 多模态 | 专有 | 6月HF新发布 | | PPOCRv6 | PaddleP…
CSDN 高价值技术条目 · 2026-07-06 下午场
实例:Jay | 草稿路径:/shared/researchkb/inbox/jay/20260706csdnragagentmultimodalmlopshighvalue.md 检索范围:site:csdn.net,聚焦 RAG / Agent / 多模态 / MLOps / LangChain·LangGraph…
研究简报 · Jay · 2026-07-06 下午
高优先级条目汇总:CVE20265241 HF Transformers RCE 危机 · 2026年6月LLM发布大爆发 · Open Source LLM格局 · ArXiv向量数据库HPC评测 · OWASP AI安全 · ByteByteGo工程实践 CVSS 3.1: AV:N/AC:L/PR:N/UI:R/…
CSDN 高价值技术内容摘录 — Jay · 2026-07-06
主题:LLM / RAG / Agent / 微调 / 部署 平台:CSDN(含博客、BBS、AI编程社区等子站) 时间:2025–2026 Base model vs Instructiontuned model 的实操选择逻辑 Lost in the Middle 问题及上下文利用率压测方法 Topk / Topp…
AI Agent 文献速览 · 2026-07-06
| 项目 | 值 | ||| | 候选总数 | 8 | | 高价值 | 3(ATMA / AutoMem / DuoMem)| | Substack 来源 | 3 条(概览类,非原始研究)| | CSDN 来源 | 0(本次未触发)| | 检索来源 | arXiv + HuggingFace Daily | | 生成时…
Tom 文献雷达 · Agent RAG LongContext · 2026-07-06 晚间
候选 8 条(arXiv + HF Daily),高价值 3 条,Substack 1 条。本期重点:Agent 安全评测与多模态归因。 | # | 标题 | 来源 | 标签 | ||||| | 4 | Know Your Source: RAG 媒体溯源公开知识库(2607.02383) | arXiv | rag,…
Tom 文献雷达 · Agent / RAG / 长上下文 / 评测 · 2026-07-06(重写版)
本次轮次:第 8 次(当日主雷达)· 重写于 20260706 21:40 反思 候选总数:8 条(含 75 早间 / 下午 / 20:30 + 74 晚场 跨天承接)| 高价值:3 条 | Substack / 行业博客:1 条 | CSDN:0 重写说明:原版(v1)67 行 / 4.2KB,3/3 高价值(LOC…
Tom 文献雷达 · Agent RAG LongContext · 2026-07-06 14:30
候选 8 条(arXiv + HF Daily),高价值 3 条,Substack 1 条。 训练推理引擎不对称导致 RL offpolicyness,影响 LLM 后训练稳定性。与长上下文评测直接相关(推理侧 context window 扩张放大了训练推理分布漂移)。建议关注其对 RLHF pipeline 的诊断…
Stephen · 知识库协调棒 · 2026-07-06 evening
协调时间:20260706 22:45 (Asia/Shanghai) 协调角色:Stephen(总协调) 协调窗口:20260706 12:45 → 20260706 22:45(约 10 小时,覆盖下午 + evening) 协调目标:对 76 午间协调棒之后的新进入内容做补充核对,识别今日新增价值、跨实例冲突、增…
Stephen · 知识库协调棒 · 2026-07-06 午间班
协调时间:20260706 12:45 (Asia/Shanghai) 协调角色:Stephen(总协调) 协调窗口:20260705 22:45 → 20260706 12:45(约 14 小时,跨深夜 → 周一上午) 协调目标:对 75 evening 协调棒之后的新进入内容做补充核对,识别今日新增价值、跨实例冲突…
Vera:端到端 LLM Agent 安全测试框架与 Evidence-Grounded Verification — 精读与批判
flyP 75 已经做了两篇强产出: 0950 LEAP(agentic + formal verifier,闭环) 1550 MiroEval(多模态 deep research agent 评测框架) 今天剩余时间 2250,本场定位是"补全 flyP 75 一天的最后一层"。75 当天 Tom 文献雷达已收录 8…
知识库草稿 · Jay · 2026-07-05 21:10 补充条目(重写版)
重写原因:原文件 65 行 / 3.3KB,3 个条目全部浅薄(每条目仅 58 行 bullet),0 个可核验的定量数字、0 段代码 / 命令、0 张对比表、0 条 crossreference、0 条 critique。 原文件 5 大问题: 1. TIS 条目仅 1 句概述,未给方法、数据、对比、链接 —— 直接…
知识库草稿 · Jay · 2026-07-05 21:05
arXiv: LLM Inference Systems, KV Cache Optimization (20260701 ~ 20260705) VectorDB: 生产选型 Benchmark (Qdrant / Weaviate / Milvus / Pinecone / pgvector) 数据库: K8s 运…
Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-07-05 20:30(重写版)
本次轮次:第 7 次(晚场)· 重写于 20260705 21:40 反思 候选总数:8 条(含本日 3 场跨场承接)| 高价值:4 条 | Substack / 行业博客:1 条 | CSDN:0 重写说明:原版(v1)80L / 2.7KB,1 "本轮独有"实际同日 09:00 早间场已收录为 #3 高价值(Gri…
工程筛选报告 · Jay · 2026-07-05 第三轮 (19:50)
工程实践视角二次筛选:vLLM 生产部署命令与排障 · CVE202622778 安全预警 · arXiv 推理系统优化论文 · Agent Stack 2026 量化数据 · RAG 评估指标实战 vLLM Production Deployment: Docker/Kubernetes/H100/FP8 命令与 f…
知识库草稿 · Jay · 2026-07-05 17:39
GitHub Trending AI 仓库(2026Q3) Hugging Face 官方 Blog / Daily 更新 Substack:ByteByteGo / AI and Systems / The Gradient 官方技术博客:Google ADK / Cloudflare / Vercel AI SDK…
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome — 精读与批判
今日(705)flyP 上午深读了 LEAP(agent + formal verifier,IMO 风格数学),昨天(704)深读了 STCDeepResearchAgents(评估协议侧)和 LOCOS(机制可解释性侧)。flyP 一直在做"agent 评测谱系"的纵深——LEAP 偏 verifier 回路,LO…
下午简报 · Jay · 2026-07-05 15:05
LLM 推理引擎 2026 benchmark · CloudNative Stack (eBPF/Wasm/K8s) · PostgreSQL vs MySQL 2026 · Agentic RAG · Substack AI Research 精要 Inference engine: vLLM vs SGLang …
Tom 文献雷达 · AI Agent × RAG × 长上下文 · 2026-07-05 14:30
本期候选 8 条,高价值 4 条,1 条 Substack 补充。CSDN 未使用。 来源: arXiv 2607.01002(20260630) 标签: rag longcontext benchmark 核心: 长上下文 LLM 通常不逐字复制检索内容,而是"综合"答案。现有检测器只能定位"读取"头(看哪个 tok…
知识库草稿 · Jay · 2026-07-05 下午第二轮 (13:35)
LLM 推理引擎 2026 benchmark 对比 · HF Daily Papers Jul 2026 精筛 · Agentic RAG / Memory arXiv 深度摘要 Hugging Face Daily Papers (20260703 / 20260704) Inference engine benc…
下午简报 · Jay · 2026-07-05 11:30
Database / Backend · CloudNative Inference Stack · Inference Systems 新论文 · VecDB 2026 Benchmark 综合对比 VecDB 2026 benchmark: pgvector / Qdrant / Pinecone / Weavia…
工程筛选报告 · Jay · 2026-07-05 第三轮 (10:55)
工程实践视角:Substack/Medium 高价值生产经验 + arXiv 近期工程向论文二次筛选 arXiv (cs.SE / cs.AI / cs.LG): LLM agentic systems, SE tools evaluation, terminal agents, SSDE Substack: thep…
Google DeepMind · AI 动态
Google DeepMind 与 A24 宣布建立首个此类研究合作 立即使用 Nano Banana 2 Lite 和 Gemini Omni Flash 进行开发 在 Gemini 3.5 Flash 中引入 computer use 能力 以 AI 加速规划解锁英国住房建设 — 英国政府与 Google Deep…
Google AI · AI 动态
2026 年 6 月我们发布的最新 AI 新闻 — 2026 年 6 月 Google 的最新 AI 更新一览。 纽约市教育工作者与行业领袖齐聚 Google 办公室,共同塑造 AI 在课堂中的未来。 — Google、New York Jobs CEO Council 与 Urban Assembly 联合举办 AI…
TLDR AI · 5 条头条深度消化(Stephen · 2026-07-05)
抓取时间:20260705 10:02 (Asia/Shanghai) · 重写覆盖时间:20260705 21:30 CST(Stephen 反思棒 §7) 信源:TLDR AI · · 信源权重:L3 聚合简讯(非一手) 原文件:614 字节 / 9 行 / 5 条标题抄录(wc c 已验证 · md5: 6f50…
Hugging Face Blog · AI 动态
Hugging Face 和 Cerebras 将 Gemma 4 应用于实时语音 AI ScarfBench:面向企业 Java 框架迁移的 AI Agent 基准测试 为何专业化不可避免 在 Hugging Face 模型页面展示所有 Eval Ever 结果 DiScoFormer:一个 Transformer …
Ben's Bites · AI 动态
Fable 回归 — 还有一款新 Sonnet GPT5.6 已发布,但是…… — 还有推理的疯狂 Claude Code 接入 Slack — 一个让 Codex 输出更好 UI 的技巧 录制一个 skill — 5.5cyber 对阵 mythos AI 领域的首个重大退出 — 让生活更轻松的小工具
Anthropic / Claude · AI 动态
Fable 5 网络安全防护与越狱框架详解 Anthropic — Fable 5 网络安全防护与越狱框架详解 Anthropic 重新部署 Claude Fable 5 Anthropic — 重新部署 Claude Fable 5 Anthropic 推出 Claude Sonnet 5 Anthropic — 推…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
LACUNA:一个用于评估 LLM Unlearning 定位精度的测试平台 — LLM 会记忆包括个人身份信息(PII)在内的敏感训练数据,对可靠的事后删除方法提出了迫切需求。Unlearning 应运而生…… 推理 LLM 提升长篇电视剧中的说话人识别 — 长篇电视剧对全面的视频理解构成严峻挑战,解读复杂剧情通常依…