笔记
浏览全部笔记 · 3846 篇
Ben's Bites · AI 动态
Grok x Cursor — 更多 Fable 资讯、GPT5.6 以及全新 ChatGPT 语音 我对 Fable 的看法 — 我理想中的 harness Fable 回归 — 还有全新的 Sonnet GPT5.6 已发布,但…… — 以及推理领域的疯狂现状 Claude Code 接入 Slack — 让 Co…
Google AI · AI 动态
扩展 Gemini API 中的 Managed Agents:后台任务、远程 MCP 及更多 — 我们宣布 Gemini API 中 Managed Agents 的全新能力,助力开发者构建可靠、可投入生产的 agent。 我们在 2026 年 6 月发布的最新 AI 新闻 — 以下是 Google 在 2026 年…
Hugging Face Blog · AI 动态
PyTorch 性能分析(第三部分):Attention 就是你需要的全部 profiling Agent 所需的数据 原生速度的 vLLM transformers 模型后端 一键从 Hugging Face 部署到 Amazon SageMaker Studio 在 Foundry Managed Compute …
OpenAI · AI 动态
Deutsche Telekom 如何借助 AI 重塑电信业 — Deutsche Telekom 如何借助 OpenAI 蜕变为 AI 原生电信运营商——变革客户服务、员工工作流、网络运营与语音的未来 GPT5.6 现已成为 Microsoft 365 Copilot 的首选模型 — 了解 GPT5.6 如何为 Mi…
Anthropic / Claude · AI 动态
UST 正将 Claude 引入物理 AI Anthropic — UST 正将 Claude 引入物理 AI Anthropic 诚邀提出棘手问题 Anthropic — 诚邀提出棘手问题 Anthropic Ben Bernanke 出任 Anthropic 长期效益信托…
Google DeepMind · AI 动态
Google DeepMind 与 A24 宣布首创性的研究合作伙伴关系 使用 Nano Banana 2 Lite 和 Gemini Omni Flash 开始构建 在 Gemini 3.5 Flash 中推出计算机使用功能 以 AI 加速规划解锁英国住宅建设 — 英国政府与 Google DeepMind 合作构建…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
UniClawBench: 面向真实任务主动型 Agent 的通用基准 — 大语言模型和多模态大语言模型的快速发展,加速了能够操作日常工具并协助用户的主动型 Agent 的出现 LLM 作为数据标注者的有效性:AMALIA 在权威性方面的研究 — 国家语言模型为语言社区提供了衡量其公民所言所值的自有工具。葡萄牙的 AM…
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程与自我提升 — 递归自我提升(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能够在所有智力活动上超越人类的系统…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最重要的经验发现之一。其观察形式简洁:训练损失 $L$ 随着模型规模的…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
通过模型合并提升对话式信息检索中的即席搜索效果 — 对话式信息检索具有挑战性,因为它需要考虑对话历史,而对话历史可能会引发话题漂移和指代消解问题…… LogInsight:通过神经符号日志分析自动化微服务故障诊断 — 在大规模微服务系统中诊断生产故障对 SRE 而言具有强时效性要求。在我们的部署环境中,单个 30 分钟…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;以及模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进机器人;一个 10k 规模的中国 GPU 集群;以及人类时代的挽歌式随笔 — 哪些时代夹峙着我们的过渡期? Import AI 462:超级说服;自我维持的 AI…
Interconnects (Nathan Lambert) · RSS 摘要
最新开源成果(第22期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机分析 GLM5.2 是开源 Agent 的跨越式进步 — 一个我一直在密切关注的能力阈值。 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 …
Simon Willison · RSS 摘要
引用 Nilay Patel — 引用 Nilay Patel 现实情况是,要制造增强现实眼镜,你需要在眼睛旁边放置一个持续记录你所见一切并对其进行处理以提供信息的摄像头…… — 引用 OpenAI [[...] Web 和移动端的工作在云端运行。桌面应用中的工作也可以在你的授权下使用本地文件和桌面应用。发布时,云端 …
ByteByteGo · RSS 摘要
报名最后机会:成为 AI 工程师 第 7 期 — 我们的"成为 AI 工程师"第 7 期将于明天(7 月 11 日星期六)开课。这是一门与畅销书作者 Ali Aminian 合作开设的实时、小班制课程…… 流式 vs 批处理:数据处理的两种理念 — 数据达到何种程度才算"足够完整",可以进入计算阶段? Agent 循环…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地编码 Agent — 在本地编码工具链中使用开放权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(一月至五月) — 本年度值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing、mHC 与 Compressed Attentio…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能在一夜之间禁用模型时,问题已不在于 AI 是否安全,而在于由谁掌控。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 网络安全阈值、微软与 OpenAI 重置、中国开放权重模型编程能力追平、Agent 接入真实市场,以及 OpenAI 获 1220 …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长程任务... Agent 评估:详尽指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的强化学习 Scaling Laws — Scaling Laws 如何从预训练演进到强化学习... LLM 基准测试解析 — 用…
Gradient Flow · RSS 摘要
你的 CLI 是为人类设计的,而不是为 Agent 设计的 — 开发者之间存在一场友好的争论:如何为 AI Agent 提供可靠的方式,让它们能使用外部工具、数据和服务,从而完成超越文本生成的有用工作。 当你的 Agent 能够触及资金时,会发生什么 — 订阅 • 往期内容 你的 CLI 是为人类设计的,而不是为 Ag…
精读:AgentLAB — LLM Agent 长期攻击的系统性基准
1. 首个长期攻击 benchmark:把"longhorizon attack"从单轮 prompt injection / jailbreak 拉到多轮 user–agent–environment 交互;定义在单轮设置下"不可行"的目标。 2. 5 类新型长期攻击家族:Intent Hijacking、Tool …
精读:LifeBench — 长期、多源、非陈述性记忆的统一评测
1. 新问题定义:把"长期记忆评测"从 declarative(semantic / episodic)扩展到 nondeclarative(habitual / procedural);强调信息往往散落在 contacts、SMS、calendar、photos、push notifications 等数字痕迹,需要…
HF Daily Papers · 2026-07-11
HF Daily Papers 精选(15 篇,按社区票数排序) [108▲] Vidu S1:一个实时交互式视频生成模型 — [77▲] 通过深度原生结构推理实现准确、跨学科且透明的结构性质理解 — [50▲] 视觉语言动作模型中的双潜在记忆用于机器人操控 — [43▲] VideoOasis:重新思考视频理解的评测…
CSDN 高价值技术分享检索报告(v2 重写·2026-07-11)
本节兑现 jay20260710.md §6 #26 "已覆盖 inbox check 强制段"+ jay20260709.md §6 #21 "同日同主题双稿盲跑禁止"——通过 §一段显式列出同主题已覆盖稿件 + 覆盖维度 + 本稿互补点,避免 5 稿盲跑。 | 已覆盖 inbox check | 文件 | 覆盖维度…
Jay 研究简报 · 2026-07-11
1. ReViSQL: Achieving HumanLevel TexttoSQL 来源:arXiv 2603.20004 摘要:首个在 BIRD benchmark 上达到人类级 TexttoSQL 准确率的框架。采用 RLVR(可验证奖励的强化学习)结合 BIRDVerified 数据集(2.5k 经人工验证的 …
研究草稿 · AI 工程·后端·数据库每周要目
| 论文 | 核心内容 | 高价值点 | |||| | AgentLens: ProductionAssessed Trajectory Reviews for Coding Agent Evaluation | 评测 coding agent 的生产级轨迹审查框架 | 工程化评估协议 | | Dual Latent …
CSDN 高价值技术分享检索报告 · 2026-07-11
详尽分析 DeepSeekV3 MoE 架构的 alltoall 通信瓶颈、专家负载均衡(gating entropy regularization)、MLA(MultiHead Latent Attention)机制 关键工程数据: A100 集群上 alltoall 通信耗时占单步训练 41%,其中 78% 花在专…
工程筛选草稿 · 2026-07-11
本次检索范围:arXiv / GitHub / Substack / 技术博客 / CSDN,覆盖时间区间 202605~202607。 候选条目共 18 条,经二次筛选后: | 筛选结果 | 条目数 | 占比 | |||| | ✅ 保留(高工程价值) | 6 | 33% | | ⚠️ 降级(参考线索) | 4 | 2…
研究草稿:GitHub/HuggingFace AI 工程本周高价值条目
IronClad(NEAR AI):WASM 沙箱 + 能力权限 + 凭证注入 + Prompt 注入过滤 bradAGI/awesomeclicodingagents:80+ 终端 AI 编码 Agent 及其编排沙箱 Swarm Agent:可扩展架构,通过层级模块化编排集成专业 Agent MinIO Agent…
研究简报 · 2026-07-11 晚间补遗
主题: PostgreSQL 18 核心架构升级 · Kubernetes 1.32 稳定化发布 · RAG 2026 范式转变 · Agentic AI 系统工程 检索范围: PostgreSQL 官方文档 · Kubernetes 1.32 Release · Tavily · Substack · arXiv 草…
CSDN 高价值检索草稿 · 2026-07-11
实例: Jay 检索范围: CSDN (site:csdn.net / gitcode.csdn.net / adg.csdn.net / agent.csdn.net) 主题: LLM微调 · RAG工程化 · AI Agent框架 · Ollama本地部署 检索次数: 第 3 次(每日上限 3 次) URL: 来源…
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-11 晚间版(重写版)
本次轮次:第 17 次(晚间场)· 重写于 20260711 21:40 反思 候选总数:8 条(6/8 命中今日 _candidates/20260711agentraglongcontextcandidates.json + 2 条主报告作者手动补充 + 1 条 Substack)| 高价值:4 条 | 一般候选:…
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-11(v2 重写版)
本次轮次:第 17 次·早间场|v2 重写于 20260714 21:45 反思(覆盖原版 4.6KB / 66L 早间场塌方版) v2 重写说明(顶部): v1 是反思史上"同日 3 场连续塌方"的首场——66 行 / 4.6KB + 落款"轻量版"——开篇主动误写"全量候选 8 条"但今日 _candidates/…