AI HOT 过去24小时精选

抓取时间:2026-09-22 12:02:03(北京时间) · 条目数量:14 · 数据来源:aihot.virxact.com

技巧与观点

  1. 卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案 — 公众号:数字生命卡兹克(2 小时前) 作者实测同日凌晨发布的 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案。 https://mp.weixin.qq.com/s?__biz=MzIyMzA5NjEyMA%3D%3D&mid=2647686569&idx=1&sn=f716d3dd70259240800a67b9fabd53fd

  2. Artificial Analysis 评测 Step 5 Preview: Intelligence Index 得 44 分,成本约为同级模型 1/2.8 — X:Artificial Analysis (@ArtificialAnlys)(2 小时前) Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max) 和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。 https://x.com/ArtificialAnlys/status/2102213621963243704

  3. OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用 — OpenRouter:Announcements(RSS)(4 小时前) OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。 https://openrouter.ai/blog/insights/nemotron-3-5-lightning

  4. Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56 — Artificial Analysis 完整文章(网页)(8 小时前) Artificial Analysis 发布 Grok 4.7 评测,该模型在 Intelligence Index 得 46 分,较 Grok 4.6 高 2 分,AA-Briefcase 得 1657 Elo(+111),仅次于 Claude Opus 5 和 Claude Fable 5.1。 https://artificialanalysis.ai/articles/benchmarking-grok-4-7

  5. 马斯克称 Grok 4.7 使 xAI 在智能体编码领域位列第三 — X:Elon Musk (@elonmusk, xAI)(10 小时前) Elon Musk 引用 Artificial Analysis 评测称,Grok 4.7 使 xAI 在智能体编码上排名第三,仅次于 Anthropic 和 OpenAI。 https://x.com/elonmusk/status/2102082011233931762

  6. Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟 — Linear:Now(RSS)(15 小时前) Linear 工程师分享如何解决 AI Agent 加速写代码后 CI 成为瓶颈的问题,PR 等待时间从 6 分钟以上降至 5 分钟出头,单测 runner 时间约减半。 https://linear.app/now/ci-bottleneck-reworked

  7. Nathan Lambert 撰文分析开源模型的中美实力格局 — Nathan Lambert:Interconnects(RSS)(16 小时前) Nathan Lambert 发布其向美国国会汇报的开源模型现状综述,指出中国开源权重模型已在下载量、基准成绩和学术采用上领先,自 2025 年 7 月起在 Hugging Face 下载量上领先约 1.6B(总 3.2B,为美国两倍)。 https://www.interconnects.ai/p/the-current-balance-of-power-in-open

模型发布/更新

  1. 小米 MiMo-V2.6-Pro 登上 Code Arena: WebDev 榜约第10名,开源权重中约第3 — X:Arena (@arena)(6 小时前) 小米发布 MiMo-V2.6-Pro 与 Flash 两款全模态模型,MiMo-V2.6-Pro 在 Code Arena: WebDev 榜以 1628 分(AutoEval)位列约第10名,开源权重(MIT 许可)中约第3,较 MiMo-V2.5-Pro 的 1475 分上涨 153 分。 https://x.com/arena/status/2102142912943489220

  2. 小米发布开放权重模型 MiMo-V2.6-Pro,登顶 Artificial Analysis 开放权重模型智能指数 — X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)(6 小时前) 小米(Xiaomi)发布开放权重模型 MiMo-V2.6-Pro,在 Artificial Analysis Intelligence Index 得分 46,超越前代 MiMo-V2.5-Pro 的 26,为开放权重模型中最高。 https://x.com/ClementDelangue/status/2102141768674222323

  3. 小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型 — X:小米 MiMo (@XiaomiMiMo)(7 小时前) 小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两个全模态模型,通过规模化强化学习训练。Pro 在多数 Agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。 https://x.com/XiaomiMiMo/status/2102138559952290106

  4. 小米发布并开源 MiMo-V2.6 系列,扩展强化学习规模迈向自我提升 — 公众号:小米 MiMo(7 小时前) Xiaomi MiMo 于今日正式发布并开源 MiMo-V2.6 系列模型,包含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。 https://mp.weixin.qq.com/s?__biz=Mzk3NTkxMTM2NA%3D%3D&mid=2247484969&idx=1&sn=76c4757b26a2b646e1b690bf78c386d8

行业动态

  1. 不列颠哥伦比亚省起诉 OpenAI,指其未在枪击案前将 flagged ChatGPT 活动转介警方 — X:Rohan Paul (@rohanpaul_ai)(7 小时前) 不列颠哥伦比亚省在加州起诉 OpenAI,指 flagged 的 ChatGPT 活动本应在 2026 年 2 月 10 日 Tumbler Ridge 枪击案前通报警方,该案致 8 人死亡(含 5 名儿童和一名教育工作者)、27 人受伤。 https://x.com/rohanpaul_ai/status/2102128625126605059

  2. 亚马逊封禁 Meta Muse 智能体代用户购物,双方争端升级 — IT之家(RSS)(16 小时前) 亚马逊阻断了 Meta 个人 AI 智能体 Muse 代用户在其网站购物的访问权限,称从未许可该访问,并指 Muse 不表明身份、会采集保存用户账号凭证,带来隐私和安全隐患。 https://www.ithome.com/1/005/418.htm

产品发布/更新

  1. Kimi 发布 Kimi Code Desktop 1.0,macOS 与 Windows 版同步上线 — 公众号:月之暗面(Kimi)(20 小时前) Kimi(月之暗面)发布 Kimi Code Desktop 1.0,作为 Kimi Code 官方桌面客户端,macOS(Apple 与 Intel 芯片)和 Windows 版同步上线,下载地址为 kimi.com/code。 https://mp.weixin.qq.com/s?__biz=MzkzMTY4NTIyNA%3D%3D&mid=2247484344&idx=1&sn=047cf702ff02ab334e3ea2ba8e34b4a6