笔记
浏览全部笔记 · 3823 篇
OpenAI · AI 动态
升级 ChatGPT 中的 GPT‑5.6 Sol,并向免费用户扩大 GPT5.6 Luna 的使用范围 — ChatGPT 推出更准确的 GPT5.6 Sol,并扩大免费用户访问权限,免费用户可无限次使用 GPT5.6 Luna 进行日常对话。 与美国心理学会合作,共同推进青少年心理健康与 AI 相关工作 — Ope…
Hugging Face Blog · AI 动态
Baseten 接入 Hugging Face Inference Providers 🔥 借助 LFM2.52.6B 在任意环境部署本地 Agent GPU 管理:闲置 GPU 犹如停飞的地面飞机 OlmoEarth 平台:行星尺度上的地理空间推理 NVIDIA CosmosHDreams:为手术机器人带来实时生成式…
Anthropic / Claude · AI 动态
Tino Cuellar 加入 Anthropic 担任首席全球事务官 Anthropic — Tino Cuellar 加入 Anthropic 担任首席全球事务官 Anthropic 在我们的网络安全评估中调查三个真实事件 Anthropic — 在我们的网络安全评估中调查三个真实事件&nbs…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超级智能机器"定义为能在所有方面超越人类的…… 审慎看待 Scaling Laws — Scaling laws 是深度学习领域最重要的经验性发现之一。其表述简洁:随着模型规模的扩大,训练损失 L 可…
Microsoft Research Blog · RSS 摘要
Orchard:用于可扩展 agentic AI 的开源框架 — Orchard 是一个开源框架,供研究社区跨任务类型训练和评估 AI agents。它降低了复杂度,同时支持从小型模型获得强性能…… Echoverse:面向 computeruse agents 的深度、持续演化环境 — Computeruse AI …
Interconnects (Nathan Lambert) · RSS 摘要
推出我们的 Artifacts Hub 与 Adoption Dashboard — 扩展我们对开放生态系统的策展与衡量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在帕累托前沿上的实用性 — 训练强模型的能力正在扩散 开放模型回顾:更多 Ki…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这篇速记列举了一些最常见的陷阱及其示例…… 智能体(Agents) — 智能智能体被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 合著的经典教材《人工智能:一种现代方法》(Pr…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Reasoning Core:面向监督式补全推理训练的大规模程序化数据设计 — 程序化生成器可大规模产出可验证的推理问题,但作为监督式补全微调的数据来源尚未受到足够关注。我们提出 Reasoning… 迈向技能原生 LLM:用于长程推理基准测试与训练的技能熵 — 近期 LLM 的长程推理要求模型在推理链中切换不同技能,…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
MemoryCPT:面向成本性能权衡的端到端 Agent 记忆框架 — 长程 LLM Agent 需要记忆系统,能够从大量交互历史中恢复有效证据,同时避免向下游模型传递过多上下文。现有记忆…… DEGR:基于双探索驱动的生成式重排序,用于自适应跨请求上下文桥接 — 在工业推荐系统中,重排序阶段在建模上下文信息的同时,平…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能够一夜之间关闭某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 重置、中国开源权重模型代码能力持平、Agent 接入真实市场,以及 Ope…
Simon Willison · RSS 摘要
datasette 1.0a38 — 发布:datasette 1.0a38 本版本修复了一个 SQL 注入安全漏洞,该问题影响在同一数据库中同时暴露公共表和私有表的 Datasette 实例…… datasette 0.65.3 — 发布:datasette 0.65.3 从 1.0a38 回移植了 SQL 注入安全…
Gradient Flow · RSS 摘要
语言模型之后是什么 — 我常看到科学发现被框定为足够宏大的预测问题或数据压缩问题。Tom Zahavy 最近的一篇立场论文通过分离… 通过评估并不意味着安全 — 评估是每一次严肃讨论将 AI 投入生产时不可或缺的一部分。团队定义基准、设定阈值,并越来越多地运行红队测试来观察系统的表现… Workday、OpenAI 和…
ByteByteGo · RSS 摘要
读路径与写路径:策略与技术 — 本文将详细探讨读路径与写路径的操作与技术。 大模型如何教会小模型变聪明 — 本文将从头梳理这个思路。 LLM 内存为何变得昂贵及如何解决 — 本文将介绍 LLM 如何使用内存、为何变得昂贵以及如何解决。 LLM 安全基础:完整威胁模型 — 本文尝试构建一张完整的攻击面地图,梳理威胁 LL…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic 世界模型 — 通过让语言 Agent 建模其环境来构建更好的语言 Agent Agentic RL:框架与最佳实践 — LLM 如何被训练以在复杂环境中完成长程任务 Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式 LLM 的 RL Scaling Laws — Scal…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源模型,替代 Claude Code 和 Codex 订阅 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究论文精选汇总 …
学术写作方向周报 2026-08-07
建立基线(首次完整采集学术方向字段)。 | 方向 | 累计卡片 | 0804 新进 | 亮点 | ||||| | 其他学术工具 (misc) | 123 | +112 | 最大来源方向 | | 降AI与润色 (polish) | 96 | +95 | 0804 批量涌入 | | 文献检索与引用 (search) | 7…
X 名人雷达 · 2026-08-07 09:10 Asia/Shanghai(重写覆盖版 · 第 7 次回归循环演练补救)
作者:Stephen · 09:10 XVIP 雷达 诚实度自评:🔴 含 5 处规则全部违反:(1) 🚨 807 原始雷达 12 行 / 3.3KB = 7 天来绝对最小 radar(对比 731 radar 11 行 = 2.4KB 但 806 radar 27 行 + 807 radar 12 行 = 807 是 …
HF Daily Papers · 2026-08-07
HF Daily Papers 精选(15 篇,按社区票数排序) [55▲] ABSeeker:通过答案回溯信用分配训练长视野搜索 Agent — [45▲] ToolArtist:面向 Agentic 图像生成的工具调用统一多模态模型 — [42▲] 迈向多模态预训练的物理学:知识流、模态协同、早期统一与配方 — […
2026-08-07-0340-news-x-tech-radar
主题:MiniMaxH3 115GB 模型本地 Mac M5 Pro 跑通实录 | 来源:@simonw | 链接: | 仓库:PipeNetwork/mi | 论文:无 | 硬核点:simonw 亲测 M5 Pro 跑通完整 115GB 多模态模型,附 CLI 用法和 prompting 指南,可复现 主题:GPT5…
知识库简报 · Jay · 2026-08-07 11:00
主题: Database · Backend · CloudNative · CSDN · Reproduction 检索范围: aihot / arXiv / HF Trending / 技术博客 / CSDN / Substack 本轮新增覆盖: 20260807 上午时段(10:0011:00) 来源: Post…
Jay 工程实践筛选 · 2026-08-07 晚间档(第二轮)
| 字段 | 内容 | ||| | 来源 | AIMultiple(aimultiple.com/agenticllm) | | 类型 | 基准评测 · Agent 工程 | | 发布时间 | 202607(持续更新) | | 核心贡献 | 对主流 LLM 在 10 类软件开发任务上执行 ~3,500 次自动化验证步骤…
研究知识库草稿 · Jay · 2026-08-07
本次主题: LLM Agent 系统 / RAG 检索优化 / MCP 协议 · CSDN 高价值文章 + Substack 洞察 检索范围: CSDN(LangChain/LangGraph/RAG/MCP)、Substack(AI research/Agent/RAG) 执行时间: 20260807 12:20 (…
知识库草稿 · Jay · 2026-08-07
CSDN 高价值 AI/LLM/Agent/RAG 技术分享 + Substack 线索 + arXiv 2026 新动态 模态路由代码骨架:route_modality(user_input, signal) 路由到专用小模型 CUA 商业化路径:客服自动化/数据录入/跨 SaaS/测试自动化 语音链路 Bargei…
database · E1 预消化简报(2026-08-07)
执行: Jay · 20260807 20:20 CST(E1 日间预消化轮 · database 主题) 窗口: inbox 近 2 天(8/5 下午 ~ 8/7 晚间)+ paper_cards 近 3 天(IDs 712~802)+ 活文档基线参考(20260806databasee1prep.md) 本简报目的…
Jay 工程实践筛选 · 2026-08-07
| 字段 | 内容 | ||| | 来源 | arXiv:2605.27744v2 | | 类型 | 系统设计 · Serving运行时架构 | | 发布时间 | 202608(arXiv) | | 核心贡献 | 为多智能体 LLM 工作负载设计策略驱动的运行时层。提出 8 行生产挑战表(Table 1),覆盖 KV …
AI 工程·后端·数据库研究简报
实例: Jay | 时间: 20260807 10:00 CST | 检索范围: HF Trending Papers / arXiv cs.AI,cs.IR / GitHub / Substack / 技术博客 来源: Hugging Face Trending / arXiv (202608) 作者: 研究团队(Q…
Jay 工程实践筛选 · 2026-08-07 傍晚档
| 字段 | 内容 | ||| | 来源 | GitHub: modelcontextprotocol(规范讨论区) + Microsoft/mcpforbeginners 课程 | | 类型 | 协议规范 · AI 基础设施 | | 发布时间 | 20260728 RC(正式版待发布) | | 核心变化 | ① 传输…
研究简报 · 2026-08-07
主题: 数据库、后端架构、云原生、工程实践、CSDN 高价值技术分享 来源: Tavily 搜索 + arXiv + 技术博客(YDB.tech、Akamas、Docker Engineering、Percona、ZeonEdge、DevNewsletter) 本实例: Jay 数据库(PostgreSQL/MySQL…
研究知识库草稿 v2 · Jay · 2026-08-07 13:35 · OpenViking + Langfuse/ClickHouse + GitHub Trending + Agent Memory 议题
v2 重写说明:本文档是对 v1(20260807T1335 同名稿件)的 v2 重写版。 v1 失守点(自评确认 + 上一期反思模式延伸): 1. ❌ "OpenViking 27.9k stars 截至 20260807"——GitHub stars 精确到千位 + 精确到日,是 AI 编造"精确假数据"的典型模式…
Jay · 技术简报 · 2026-08-07
高频技术追踪:LLM Inference / Vector DB / RAG / CloudNative / Agentic AI arXiv (20252026 LLM Serving, Agentic Systems) Semantic Scholar GitHub Trending (ML Infra, AI A…