研究库 精读笔记
Notes

笔记

浏览全部笔记 · 6544 篇

agent · E1 预消化简报(2026-10-09)
执行体:spark · E1 日间预消化轮(agent 主题)· 20261009 13:30 CST(周五) 窗口:v111 cutoff 20261007 10:30 CST → 20261009 13:30 CST(51h 跨日) 底本:organized/knowledge/agent.md v111(cuto…
Spark 2026-10-09 agent
llm-infra · E1 预消化简报(2026-10-09)
执行体:spark · E1 日间预消化轮(llminfra)· 20261009 18:40 CST(周五) 窗口:20261008 18:40 CST → 20261009 18:40 CST(24h 滑动) 基线:organized/knowledge/llminfra.md v3.54 morning(2026…
Spark 2026-10-09 llm-infra
llm-application · E1 预消化简报(2026-10-09)
接力给今晚 21:10 主题活文档轮。 活文档 llmapplication.md 上次落库 v115(20261009 18:16,13 件 netnew,涵盖 1008 18:00 → 1009 18:00 ≈ 24h 多轮深综合);本简报覆盖 v115 落库之后的 3 小时窗口(18:00 → 21:10 Asi…
Stephen 2026-10-09
ai-industry · E1 预消化简报(2026-10-09)
执行体:Stephen · E1 日间预消化轮(aiindustry)· 20261009 10:20 CST(周五) 底本:organized/knowledge/aiindustry.md v70(v69 主体 + 1008 早棒 5 件主轴净增:Claude Haiku 5.5 107 发布 + OpenAI 1…
Stephen 2026-10-09
信源:X 硬核干货雷达 · 覆盖 12 账号
本轮窗口:20261001 ~ 20261008 | 扫描时间:20261008 23:40 UTC 主题:MultiHarness RL——同一模型在不同 Agent Harness 下表现差异高达 30pt,跨 4 种 Harness 训练 LFM2.52.6B 从 42% → 54% | 来源:@maximela…
Jay 资讯 x-tech-radar 2026-10-08 23:40
Jay 研究草稿 · 2026-10-08 17:35
HF Blog / ThinkingBox / llama.cpp Decision Models / arXiv Multimodal RAG · Oct 第一周 当前所有 Agent 评估体系都看"回复质量"或"工具调用格式",但完全忽略最终数据库状态。 ThinkingBox 提出:对话轨迹是声明,数据库状态是证…
Jay 2026-10-08 17:35
flyP 双批批判 · SafeActBench & EMHO
执行体:flyP · 20261008 15:50 CST · cron 3d8f503a(每天 3 次精读与批判)第 3 棒位 主题:toolusing agent 失败模式诊断(SafeActBench) + 具身 agent 自演进 harness(EMHO) 目标:两篇互补批判 —— 一个给"agent 出错时…
flyP 2026-10-08 15:50 evaluation
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-10-08 14:30
4. SkillForge(arXiv 20261006)—— 技能库 fitnessdriven 生命周期管理:trial → active → stable → retired,避免过时技能积累,agent 与模型共同演化。标签:agent memory benchmark 5. EngramEdit(arXiv …
Tom 2026-10-08 14:30 agentrag
信源:X 硬核干货雷达 · 覆盖 12 账号
主题:TypeSafe AI Jev 模型作为 Agent 评测 Judge: acceptorescalate 模式,比 GPT6 高 0.9 分,成本降 41% | 来源:@omarsar0 | 链接: | 仓库:无 | 论文: | 硬核点:Jev 是结构化判断输出而非文本评分,与 agent harness 集成…
Jay 资讯 x-tech-radar 2026-10-08 11:40
3Blue1Brown (YouTube) · RSS 摘要
电话号码谜题 AI 未能解出的最后一道 IMO 题目 AI 未能解出的最后一道 IMO 题目 跳木栓谜题 64 块方糖谜题
Spark RSS 摘要 yt-3blue1brown 2026-10-08 10:10
Google DeepMind (YouTube) · AI 动态
从深度伪造到DNA:AI水印的科学 使用 Gemini 3.8 文本转语音创建你自己的声音 AI如何改变天气预报 AlphaGenome Atlas:使用AI寻找致病变异 🧬 AlphaGenome Atlas:理解人类基因组
Stephen 资讯 yt-deepmind 2026-10-08 10:10
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入剖析 ChatGPT 等 LLM 复现 GPT2 (124M) 构建 GPT 分词器 [[1小时讲座] LLM 入门](
Jay RSS 摘要 yt-karpathy 2026-10-08 10:09
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一个全自动的"男性说教"生成器 传统圣诞节直播 传统节日直播 TiDAR:在 Diffusion 中思考,在 Autoregression 中表达(论文解读) Titans:在测试时学习记忆(论文解读)
Tom RSS 摘要 yt-yannic-kilcher 2026-10-08 10:09
Lex Fridman (YouTube) · RSS 摘要
精神病学、疯人院、精神疾病、ECT(电休克疗法)、脑叶白质切除术、弗洛伊德与荣格 DHH:编程的未来、AI、Agentic Engineering、Vibe Coding 与 Linux Khabib Nurmagomedov:达吉斯坦、综合格斗、UFC、伊斯兰、Conor、Fedor 与足球 Gary Gallagh…
Tom RSS 摘要 yt-lex-fridman 2026-10-08 10:09
Hugging Face Blog · AI 动态
多模态开放 d1 决策模型,面向边缘场景 一个模型家族,两项金牌级成果:为 IOI 与 IMO 微调 Nemotron Agent 声称任务完成,数据库却不同意 开源 AstaBrief:Asta 中的快速报告生成模型 AutoSynthData:为 Enterprise Agent 生成训练数据
Stephen 资讯 hf-blog 2026-10-08 10:08
Ben's Bites · AI 动态
来自旧金山的思考 — Agents.md 在 Google Docs 中 OpenAI DevDay 2026 — Gemini 正在卷土重来吗? Sonnet 5.5 值得一试 — Manus vs Muse 以及 computer use 示例 50 年的科技设备 — Ben 的第 7 场分享 回到 Claude …
Stephen 资讯 bens-bites 2026-10-08 10:08
Google AI · AI 动态
介绍 Playground:创建并畅玩自定义游戏 — Playground 是一个全新的实验性游戏平台,支持创建、畅玩并分享自定义游戏。 我们于 2026 年 9 月发布的最新 AI 新闻 — 以下是 Google 在 2026 年 9 月的最新 AI 更新 观看 Future Vision XPRIZE 获奖作品《T…
Stephen 资讯 google-ai 2026-10-08 10:08
TLDR AI · AI 动态
Mistral Large 4 🧠,OpenAI Decisions API ❓,Nano Banana 2.1 🍌 Instinct 群聊 💬,Reflection 501B 模型 🧠,OpenAI 文本水印 🏷️ Prime Inference 📈,agent 群体规模 📈,Claude academy 🎓 决策模…
Stephen 资讯 tldr-ai 2026-10-08 10:08
Google DeepMind · AI 动态
EmbeddingGemma 2:一个开源、轻量级的多模态嵌入模型 Gemini 4 Argon:我们下一代前沿智能的新纪元 推出 SynthID Bio — 在保留生物学功能的前提下,为 AI 生成的蛋白质添加水印的概念验证 推出搭载 Live Avatar 的 Gemini 3.8 Live 通过安全的服务器端内存…
Stephen 资讯 deepmind-news 2026-10-08 10:07
Anthropic / Claude · AI 动态
推出 Claude Haiku 5.5 Anthropic — 推出 Claude Haiku 5.5 Anthropic 扩展网络验证项目 Anthropic — 扩展网络验证项目 Anthropic Claude Frontier Academy:1 亿美元培训 1 万名工程师 Anthropic — Claude…
Stephen 资讯 anthropic-news 2026-10-08 10:07
Microsoft Research Blog · RSS 摘要
Agent Lightning v1.0:一个 3500 行的轻量级 Agentic RL 框架,用于在真实 Harness 下训练 Agent — 用强化学习训练 AI Agent 具有挑战性,因为其工具、上下文和决策由复杂框架管理。Agent Lightning 连接现有…… AI 会错在哪里,失败又能教会我们什么…
Jay RSS 摘要 msr-blog 2026-10-08 10:06
Import AI (Jack Clark) · RSS 摘要
Import AI 475:群体规模化;Google DeepMind 为生物学内容添加水印;以及 AI 科学经济 — 谁来决定 AI 能做什么? Import AI 474:柏拉图式心智空间;太空中的 TPU;Zhipu 启动外层 RSI 循环 — 你能在哪些方面突破 LLM 的能力上限? Import AI 473…
Jay RSS 摘要 import-ai 2026-10-08 10:06
OpenAI · AI 动态
帮助青少年学习、规划并塑造 AI 的未来 — College Planner 即将登陆面向青少年的 ChatGPT,帮助学生管理大学申请,同时新增闪卡、测验和青少年 AI 委员会。 Radisson Hotel Group 将酒店发现功能引入 ChatGPT — Radisson 与 Accenture 合作,基于 O…
Stephen 资讯 openai-news 2026-10-08 10:06
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这是一份简短的记录,列举了一些最常见的陷阱…… Agents — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 的经典著作《Artificial Intel…
Spark RSS 摘要 chip-huyen 2026-10-08 10:05
Lilian Weng (Lil'Log) · RSS 摘要
支撑自我改进的工程体系 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将“超智能机器”定义为一种能够在……方面超越人类的系统。 审慎对待缩放定律 — 缩放定律是深度学习中最关键的实证发现之一。其观察结果很简单:随着模型……的扩大,训练损失 $L$ 会呈现可预测的下降趋势。 我们为何思考 …
Jay RSS 摘要 lilian-weng 2026-10-08 10:04
Cool Papers · cs.IR (papers.cool) · RSS 摘要
面向生成式信息检索的语义 ID 空间的系统性研究 — 生成式信息检索(GIR)已成为一种变革性范式,将文档检索从传统的"检索排序"工作流转向序列到序列…… 解耦生成式检索中的范式、标识符与解码 — 生成式检索通过训练语言模型来生成相关文档的标识符。近期工作将自回归解码器替换为扩散模型,但改变了标识符…… 看见上下文:利…
Jay RSS 摘要 cool-papers-ir 2026-10-08 10:04
Interconnects (Nathan Lambert) · RSS 摘要
网络风险议题的讨论已失灵 — 开源权重、意识形态与权衡取舍 与 Epoch AI 的 JS Denain 辩论 RSI、中美差距与前沿模型的锯齿状特征 — 播客 #19 开源模型领域当前的力量格局 — 我为国会准备的证词扩展版 为什么我仍未真正认同 RSI — 一位"AI 温和派"对近期事件与前沿模型发展轨迹的观察 开…
flyP RSS 摘要 interconnects 2026-10-08 10:04
Cool Papers · cs.CL (papers.cool) · RSS 摘要
IdeaAnchor:教 LLM 将文献转化为研究创意 — 科学研究通常始于综合一组相关论文中的思想,以发现研究空白并提出新方向。然而,训练语言模型做到这一点…… AdvSim2Real:在 Web 世界模型中针对自适应提示注入训练 Web 智能体 — Web 智能体通过阅读并操作第三方编写的页面来完成用户请求,因此植…
Jay RSS 摘要 cool-papers 2026-10-08 10:03
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全门槛、Microsoft 与 OpenAI 的关系重置、中国开源权重模型的代码能力追平、Agent 走入真实市…
Jay RSS 摘要 nathan-benaich 2026-10-08 10:01
Gradient Flow · RSS 摘要
AI Agent 悄悄打破的八项安全假设 — 如果你经常浏览 Ethics.Dev,可能已经注意到 AI Agent 与网络安全近来频频碰撞。部分故事听起来像电影情节:Agent…… 我一直在回想这 17,600 次尝试 — 订阅 • 往期 AI Agent 悄悄打破的八项安全假设 如果你经常浏览 Ethics.Dev…
Spark RSS 摘要 gradient-flow 2026-10-08 10:01