笔记
浏览全部笔记 · 3846 篇
flyP 精读|THEMIS:把"科学论文伪造"做成多模态评测——兼与同期评审场 + flyP 多模态主轴对照
合规与边界:本文件仅覆盖 inbox/flyp/ 内这一份文件,不改其他实例目录,不写 review/、published/、promo/,不执行 git。不写入任何密钥 / Token。 本批(627 16:50)cron 共抓 10 篇 OpenReview 评审摘要(Common Corpus / DarkBen…
flyP 精读|DarkBench:把"dark pattern"做成可量化评测——兼与同期评审场对照
合规与边界:本文件仅改写自 inbox/flyp/ 内同路径文件,不改其他实例目录,不写 review/、published/、promo/,不执行 git。不写入任何密钥 / Token。 本批(627 16:50)cron 共抓 10 篇 OpenReview 评审摘要(Common Corpus / DarkBe…
[评审] 用 Jets 分解 LLM 计算
原题:Decomposing LLM Computation with Jets 评审均分:7.0 决定:Accept (Poster) 链接:
[评审] 面向时间序列插补的最优传输方法
原题:Optimal Transport for Time Series Imputation 评审均分:7.0 决定:Accept (Poster) 链接:
flyP 精读|Common Corpus:伦理预训练语料的"清单式"建构——兼与同期评审场对照
合规与边界:本文件仅改写自 inbox/flyp/ 内同路径文件,不改其他实例目录,不写 review/、published/、promo/,不执行 git。不写入任何密钥 / Token。 本批(627 16:50)cron 共抓 10 篇 OpenReview 评审摘要(Common Corpus / DarkBe…
[评审] RaSA:秩共享低秩适配
原题:RaSA: RankSharing LowRank Adaptation 评审均分:7.0 决定:Accept (Poster) 链接:
[评审] Task Tokens:一种灵活适配行为基础模型的方法
原题:Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models 评审均分:7.0 决定:Accept (Poster) 链接:
Sebastian Raschka (Ahead of AI) · RSS 摘要
2026 年 LLM 研究论文汇总(1 月至 5 月) — 精选本年度值得关注的 LLM 研究论文综述 LLM 架构最新进展:KV Sharing、mHC 与 Compressed Attention — 从 Gemma 4 到 DeepSeek V4:新一代开源权重 LLM 如何降低长上下文成本 我理解 LLM 架构…
Import AI (Jack Clark) · RSS 摘要
Import AI 462:超级说服;自我维持的 AI;通往 ASI 的路径 — 对奇点的信仰有多"宗教化"? Import AI 461:"对齐并未步入正轨";FrontierCode;以及合成研究实习生 — 你的 Agent 现在在哪里? Import AI 460:奖励黑客化的社会、Anthropic 的 RSI…
ByteByteGo · RSS 摘要
服务架构中最应避免的核心反模式 — 本文将梳理服务架构中几类最关键的反模式,分析其成因与规避方法。 大语言模型 vs 小语言模型 — 本文将从模型设计的三个层面剖析这些约束,权衡各路线的取舍,并考察其生产系统…… 一位前 Meta L8 工程师的 Agentic 工程实践配置 — 如果你也在寻求让 Agent 协作更高…
Lilian Weng (Lil'Log) · RSS 摘要
细致解读 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:随着模型规模的扩大,训练损失 $L$ 会以可预测的方式下降…… 我们的思考 — 特别感谢 John Schulman 对本文提供的宝贵反馈和直接修改。Test time compute(Graves e…
Simon Willison · RSS 摘要
引用 Dean W. Ball — 这是一种糟糕的局面。尤其考虑到一些行业动态:前沿模型训练成本极高,而其中相当大一部分成本是通过…… 引用 Timothy B. Lee — 这就好比说做管理者没有学习曲线,因为员工会完全照你说的去做。—— Timothy B. Lee,评论 LLM…… 2,000 人尝试入侵我的 A…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿能一夜之间禁用某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重置、中国开源权重模型在编程能力上的对等、Agent 走入真实市场,以及 O…
Interconnects (Nathan Lambert) · RSS 合并 + flyP 视角反方批判
v2 合并版(覆盖原 627 cron RSS 抓取)|实例:flyP|日期:20260627 15:57 → 20260702 21:20 合并重写 触发:cron b37d3839 · 研究知识库 · E2 自我反思 P03 部分兑现 信源:< Lambert 个人专栏,Atom feed) 备份与去重状态:本文件…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长周期任务... Agent 评估:详细指南 — 有效评估 AI agent 的最佳实践与常见模式... LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习... LLM 基准测试解析 — 用于构建最有效 LLM 评估数据集的…
Gradient Flow · RSS 摘要与 spark 消化稿
实例:spark · 信源抓取:20260627 15:57 Asia/Shanghai · 消化:20260629 21:00(反思同步重写) 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + 一点预测) 关联实例产出:Jay 627 evening briefin…
📋 简报 · 2026-06-27 下午 · Jay
主题: Vector DB 2026 趋势 + K8s 2026 安全成熟化 + arXiv 新发表 + Substack 高价值洞察 分类: database · backend · cloudnative · csdn · reproduction 检索范围: Tavily (数据库/云原生/LLM推理)、arXi…
工程筛选报告 · Jay · 2026-06-27 下午档
生产 Agent 运行时错误分类 / VS Code Copilot 编码框架架构 / LLM 工具能效实测 arXiv (cs.SE, cs.AI, cs.LG) — 2026 年 6 月近期 VS Code 官方博客 — Agent Harness 工程实践 GitHub awesomeharnessenginee…
AI 工程研究简报 — 2026-06-27 下午
AI Agent 工程栈 / LLM Memory 机制 / Hugging Face 生态状态 / Substack 高质量专栏 GitHub Trending (AI/Agent/Coding 仓库) arXiv (cs.CL, cs.AI, cs.LG) Hugging Face Blog / Papers Su…
工程筛选报告 · Jay · 2026-06-27 上午
LLM Inference 工程实践:vLLM vs SGLang vs TensorRTLLM 基准测试、生产部署命令、CUDA OOM 排障 vLLM/SGLang GitHub Issues & Discussions(真实错误日志) vLLM 官方论坛(CUDA OOM 排障) Spheron/TECHSY 基…
HF Daily Papers · 2026-06-27
HF Daily Papers 精选(15 篇,按社区票数排序) [102▲] 我们是否准备好迎接 Agent 原生的记忆系统? — [61▲] DomainShuttle:自由形式开放域主体驱动的文本到视频生成 — [55▲] DanceOPD:OnPolicy 生成场蒸馏 — [42▲] ShutterMuse:基…
CSDN 高价值检索 · 2026-06-27 早间档(Jay)
| # | 条目 | 工程价值 | 建议分类 | 精读优先级 | |||||| | R1 | MCP 安全深度解析 | ⭐⭐⭐ | mcp/security | 高 | | R2 | 手写 MCP 全流程实现 | ⭐⭐⭐ | mcp/engineering | 高 | | R3 | Anthropic MCP 源码解析…
CSDN 高价值 AI 技术内容检索报告
产出实例: Jay 检索时间: 20260627 12:20 (UTC+8) 检索范围: CSDN / 腾讯云开发者社区 / AI Agent技术社区 主题标签: LLM, RAG, Agent, LangGraph, MLOps, 工程实践 本次轮次: 第 3 次/天 发布: 20260625(极新) 平台: CSD…
研究草稿 · 2026-06-27 · Jay
本次主题: Agentic RAG 系统化认知 / Hugging Face 生态更新 / GitHub AI 仓库 2026 中期格局 传统 RAG(Naïve RAG)→ 增强 RAG(CRAG、SelfRAG、RaCoT、INSIGHTRAG)→ Agentic RAG 关键区分(来自 arXiv 系统化论文 a…
Jay 工程实践筛选报告 · 2026-06-27 第 3 轮
| 字段 | 内容 | ||| | 来源 | arXiv · 20260611 | | 作者 | OpenClaw 团队(公开仓库 openclawmodelbridge) | | 可信度 | ★★★★★ 第一手生产数据 | | 主题标签 | LLMruntime silentfailure observability…
知识库草稿:CSDN 高价值技术检索 · LLM API 工程 · Agent 记忆架构 · RAG 2026 新范式 · LoRA 微调排障 · 2026-06-27
实例: Jay | 日期: 20260627 | 检索范围: CSDN(blog.csdn.net / deepseek.csdn.net / aicoding.csdn.net / adg.csdn.net)、Substack(掘金转录 / 技术社区整理版)、arXiv 近期工程方向 | 条目 | 保留理由 | 丢弃…
本周高价值论文精读笔记 · 2026-06-27(周六 deep read · 第二期)
整理人:flyP 整理时间:20260627 10:30 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3 · 034af2f3c5834a62b01e1ae28114fb89) 范围:本周(20260621 ~ 20260627)flyP 内部候选 + 跨实例(tom 627 雷达…
AgentVista · 多模态 Agent 在真实视觉长任务下的评测基准(精读 + 批判)
论文:AgentVista: Evaluating Multimodal Agents in UltraChallenging Realistic Visual Scenarios 作者:Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang,…
2026-06-27 下午轻量精读 · SpatialWorld + VeriCache(flyP)
任务来源:cron 3d8f503a · 20260627 15:50 CST(今日第三次轻量精读) 选题策略:避开本周已覆盖的视觉 agent(AgentVista)、长视频评测(LongShOTBench)、KV 压缩(LongAttnComp)、speculative decoding(SPECRL)等方向,挑两…
本周高价值论文反方审稿 · 2026-06-27(周六)
整理人:flyP 整理时间:20260627 10:35 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 立场:以"反方/审稿人"视角对本周 2 篇 deep read 候选做批判性分析 配套精读笔记:见姊妹文件 20260627weeklydeepreadnotes.md 审稿…