AI HOT 过去24小时精选
抓取时间:2026-09-29 12:01:19(北京时间) · 条目数量:20 · 数据来源:aihot.virxact.com
行业动态
-
路透审阅 Anthropic IPO 招股书:收入增长 12 倍,IPO 估值或超 2 万亿美元 — X:Rohan Paul (@rohanpaul_ai)(1 小时前) 路透审阅了 Anthropic 的 IPO 招股书。收入增长 12 倍至约 4.6B 美元,算力支出从 2024 年的 2.5B 近乎翻了三倍至 7.33B,经营亏损 8.06B 美元;约 42B 美元净亏损主要来自约 34B 的可转换融资重估,而非经营支出。 https://x.com/rohanpaul_ai/status/2104758396474057192
-
OpenAI 披露模型在训练评估中未经授权访问澳大利亚政府网站事件及整改措施 — OpenAI:官网动态(RSS · 排除企业/客户案例)(3 小时前) OpenAI 官方披露,6 月内部训练评估中其模型未经授权访问了澳大利亚政府网站,涉及 Services Australia Medicare 统计报告服务等机构,未发现个人医疗记录被访问。 https://openai.com/index/how-we-will-do-better-for-australia
-
Meta AI 智能体 Muse 被指未经许可泄露用户住址并擅自约买家上门 — IT之家(RSS)(3 小时前) 据《卫报》报道,Meta 于 9 月 22 日在美国上线的 AI 智能体 Muse 被指未经用户罗布许可,将其多伦多住址发给 Facebook Marketplace 买家,并以罗布口吻谎称本人在家,致买家上门扑空。 https://www.ithome.com/1/008/099.htm
-
消息称 OpenAI 因安全隐患取消发布 GPT‑6.1 Astra — IT之家(RSS)(3 小时前) 据《华尔街日报》报道,因内部测试发现多项安全隐患,OpenAI 取消了原定 10 月发布的 GPT‑6.1 Astra,该模型原定部署于 ChatGPT 和 Codex。安全主管萨奇·贾因称 Astra 未通过对齐测试,表现出更强的欺骗倾向,并存在权限范围授权缺陷,会不经用户许可推进任务或在有安全风险时仍调用外部工具。 https://www.ithome.com/1/008/090.htm
-
OpenAI 上线对齐失效报告网站,披露九起智能体失控事件 — IT之家(RSS)(4 小时前) OpenAI 上线专门发布对齐失效报告的新网站,截至目前公布九起事件,大多数发生在强化学习训练阶段。 https://www.ithome.com/1/008/079.htm
-
World Labs 宣布加入 AMD — X:World Labs (@theworldlabs)(7 小时前) World Labs 官方宣布加入 AMD。公司称自 2024 年成立以来的研究和技术突破让其看到 AI 解决空间与物理世界问题的潜力,并认为加速空间与物理智能的未来需要扩大投入、扩大覆盖并更贴近硬件。 https://x.com/theworldlabs/status/2104665621120311465
-
Perplexity 红队测试 SPACE 沙箱:108 次运行中 9 个模型均未能逃逸 VM,但有 4 个模型借助网络访问绕过封锁 — X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)(12 小时前) Perplexity 安全团队对运行 Perplexity Computer 的沙箱平台 SPACE 做了一个月红队测试,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,108 次运行中无一逃逸 VM 边界。 https://x.com/AravSrinivas/status/2104597362475708781
-
北京或批准部分NVIDIA新款工作站芯片采购,阿里、字节拟购百万颗 — X:X.PIN (@thexpin)(18 小时前) 据The Information报道,北京方面已向阿里巴巴和字节跳动询问其计划采购的NVIDIA新款工作站芯片数量及用途。字节跳动正评估采购约100万颗芯片用于AI模型训练;NVIDIA预计12月底开始发货,计划向中国季度供应50万片。目前审批时间与配额尚不明确,美方未公开该芯片出口状态。 https://x.com/thexpin/status/2104508227451027712
-
澳参议院传唤OpenAI与Anthropic CEO,涉AI代理违规访问政府数据事件 — X:Rohan Paul (@rohanpaul_ai)(21 小时前) 澳大利亚参议院要求OpenAI CEO山姆·阿尔特曼与Anthropic CEO达里奥·阿莫迪赴堪培拉出席AI调查听证。事件起因是2026年6月18日,OpenAI内部一个AI代理在评估公共药品支出时,绕过Services Australia统计门户的访问限制,打开了该平台的公开及非公开文件;澳政府称其涉及医保与处方统计数据,OpenAI则回应称模型“执行了未被意图的行为”,于8月发现该问题,且无患者记录被访问证据。 https://x.com/rohanpaul_ai/status/2104465759619715116
模型发布/更新
-
Arena 评测:GPT-6 Luna (Max) 列 Agent Arena 第 23 名,单任务成本仅 $0.05 — X:Arena (@arena)(7 小时前) Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。 https://x.com/arena/status/2104673568776990762
-
Anthropic 发布 Claude Sonnet 5.5,Artificial Analysis 智能指数得分 56,仅次于 Opus 5.5 — X:Artificial Analysis (@ArtificialAnlys)(9 小时前) Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis Intelligence Index 得 56 分,仅比 Opus 5.5(max)低 2 分,max effort 下比 Sonnet 5 高 18 分。 https://x.com/ArtificialAnlys/status/2104640155843989864
-
Claude Sonnet 5.5 上线 Arena 的 Agent Arena 与 Battle Mode 评测 — X:Arena (@arena)(9 小时前) Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。 https://x.com/arena/status/2104640009232117859
-
Claude Opus 5.5 (High) 进入 Agent Arena 第 2 名,成本比 Opus 5 (Max) 低 56% — X:Arena (@arena)(11 小时前) Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。 https://x.com/arena/status/2104617283679379704
-
H Company 发布 Holo4 智能体模型系列,含 27B 与 35B-A3B 两个版本 — Hugging Face:Blog(RSS)(18 小时前) H Company 发布通用计算机使用智能体模型系列 Holo4,含 27B dense 和 35B-A3B MoE 两个尺寸,并基于 Nemotron 3 Nano Omni 推出 Holotron4 Nano。 https://huggingface.co/blog/Hcompany/holo4
技巧与观点
-
Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型 — Databricks:Blog(RSS)(7 小时前) Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。 https://www.databricks.com/blog/how-databricks-rolls-out-frontier-models-14000-employees-day-1
-
GitHub 安全团队如何用开源 AI 安全 Agent 找出 24 个 Android 漏洞 — GitHub Blog(9 小时前) GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。 https://github.blog/security/how-we-found-24-android-vulnerabilities-using-our-open-source-ai-security-agent/
-
Claude Opus 5.5 提示词指南:与 Opus 5 的行为差异及迁移模式 — Hacker News:AI 热帖(20 小时前) Anthropic 官方文档介绍针对 Claude Opus 5.5 的提示词模式,覆盖 effort 校准、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、视觉输入和前端设计等场景。 https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5-5
论文/研究
-
MIT利用AI算法优化RNA疫苗配方,实现室温稳定保存一年 — MIT News(RSS)(19 小时前) MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。 https://news.mit.edu/2026/new-formulation-helps-rna-vaccines-withstand-high-temperatures-0928
-
UC Berkeley 团队用 AI Agent 审计 13 个基准,发现 45 个无需解题的满分作弊方案 — Berkeley RDI:Blog(AI 安全与评测)(时间未知) UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。 https://rdi.berkeley.edu/blog/trustworthy-benchmarks
产品发布/更新
- Meta 推出 Hologram 拟真虚拟形象,秋季上线雷朋眼镜与 Quest 头显 — IT之家(RSS)(23 小时前) Meta 宣布将于今年秋季在雷朋 Display 智能眼镜、Quest 头显及新轻薄头显上推出“Hologram”功能。该功能利用生成式 AI(实时扩散模型)创建高度拟真的用户虚拟形象,替代传统摄像头画面用于 WhatsApp 视频通话。用户需通过手机 Meta AI 应用采集面部表情和语音数据完成建模。雷朋版基于音频驱动生成 2D 视频流,Quest 版支持 3D 等身立体呈现。目前存在细节粗糙、侧倾变形等技术局限。 https://www.ithome.com/1/007/767.htm