AI HOT 过去24小时精选
抓取时间:2026-08-13 12:02:01(北京时间) · 条目数量:11 · 数据来源:aihot.virxact.com
论文/研究
-
新兴多智能体系统的模式与问题 — Anthropic:Research(发表成果 · 网页)(2 小时前) Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。 https://www.anthropic.com/research/multiagent-systems
-
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈 — Google Research:Blog(网页)(10 小时前) Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。 https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality
技巧与观点
-
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验 — 公众号:数字生命卡兹克(5 小时前) DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。 https://mp.weixin.qq.com/s?__biz=MzIyMzA5NjEyMA%3D%3D&mid=2647685175&idx=1&sn=64c383b5b757945397894270c5f38301
-
AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求 — GitHub Blog(10 小时前) AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。 https://github.blog/open-source/maintainers/your-contributors-are-ai-first-now-is-your-project
-
我写了一本 AI 教科书--AI 还要多久才能写得更好? — Nathan Lambert:Interconnects(RSS)(15 小时前) 作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。 https://www.interconnects.ai/p/i-wrote-an-ai-textbook-how-long-until
产品发布/更新
-
Claude in Chrome 侧边栏升级为 Claude Cowork 会话 — Claude:Blog(网页)(7 小时前) Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。 https://claude.com/blog/cowork-chrome-side-panel
-
Meta 开源 Muse Glimmer 登陆 OpenRouter — X:OpenRouter (@OpenRouter)(16 小时前) Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线!
这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。
https://openrouter.ai/meta/muse-glimmer-30b https://x.com/OpenRouter/status/2087509478480765218
模型发布/更新
-
阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文 — IT之家(RSS)(11 小时前) 阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。 https://www.ithome.com/0/989/001.htm
-
微软首发自研推理模型MAI-Thinking-1 — X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)(12 小时前) 我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。 https://x.com/mustafasuleyman/status/2087570047967408396
-
LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI — IT之家(RSS)(21 小时前) LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。 https://www.ithome.com/0/988/766.htm
行业动态
- Research Gold 号称"100%人类撰写、绝不使用AI",实则全程由AI驱动 — Hacker News 热门(buzzing.cc 中文翻译)(22 小时前) 面向医学研究者的网站 Research Gold 宣称其服务"100%由人类撰写、绝不使用AI",并列出多名博士审稿人。但调查发现,这些审稿人系AI生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称"Sarah"的AI助手坚称自己是真人,邮件与聊天回复也均为AI生成。 https://www.404media.co/company-offering-100-human-written-never-ai-peer-review-is-entirely-ai