资讯流
163 条 · AI 官方信息 + X 技巧资讯(确定性 RSS 采集,非论文)
2026-08-22-2340-news-x-tech-radar
主题:GELU 手写 vs 内置 PyTorch 实测差 20% | 来源:@rasbt | 链接: | 仓库:无 | 论文:无 | 硬核点:Giles Thomas 实测换 PyTorch 内置 GELU 后训练快 20%,rasbt 计划写进 LLMsfromscratch 教材 bonus,附 profiling…
2026-08-22-1140-news-x-tech-radar
主题:Sakana AI Conductor(ICLR 2026)——7B 模型用 RL 调度其他 LLM 协作,AIME25/GPQAD 达 SOTA | 来源:@omarsar0 | 链接: | 仓库:无 | 论文:arxiv Conductor 相关 | 硬核点:递归 LLM 拓扑+在线迭代 testtime s…
2026-08-21-2340-news-x-tech-radar
主题:ExtractBench——企业文档结构化提取最全评测基准(370 docs/4869 pages/67类/8领域/14系统) | 来源:@jerryjliu0 | 链接: | 仓库:runllama/ExtractBench | 论文: | 硬核点:LlamaIndex 放出 36 页白皮书+代码+数据集,全面…
2026-08-21-1140-news-x-tech-radar
主题:Gemini 3.7 Flash 定价隐性翻倍,上下文窗口缩水 | 来源:@simonw | 链接: | 仓库:无 | 论文:无 | 硬核点:revealed 1M→128k context 实际窗口,input $0.15→$0.30/M翻倍,output $6→$10/M翻3倍,避坑指南值得写攻略 主题:Ex…
2026-08-20-2340-news-x-tech-radar
窗口:20260813 ~ 20260820 主题:ExtractBench——企业文档提取最全基准(370 docs/4869页/67类/8领域) | 来源:@jerryjliu0 | 链接: | 仓库:runllama/ExtractBench | 论文: | 硬核点:LlamaParse Agentic Plus…
2026-08-20-1140-news-x-tech-radar
主题:MetaHarness: 端到端自动化优化 Agent Harness(COLM 2026) | 来源:@omarsar0 | 链接: | 仓库:stanfordirislab/metaharness | 论文: | 硬核点:用 coding agent 自动搜索/优化 harness 代码,每次迭代 10M t…
2026-08-19-2340-news-x-tech-radar
采集时间窗口:20260812 ~ 20260819(过去 7 天) 本轮无干货候选。 主题:Agent 团队协调失败模式 41 类分类法 | 来源:@omarsar0 | 链接: | 仓库:无 | 论文: | 硬核点:41 种 agent harness 交互失败模式归因图谱(model/harness/tools/…
X 硬核干货雷达
扫描时间窗口: ~Aug 1118 2026 · 硬核筛选:实现技巧/性能优化/踩坑复盘/新工具用法/论文要点 主题:ExtractBench——LlamaIndex 企业文档提取基准,370 文档/67 类/8 领域 | 来源:@jerryjliu0 | 链接: | 仓库:runllama/ExtractBench …
X 硬核干货雷达
扫描窗口:20260811 ~ 20260818 主题:全行业加密推理块可被弱模型蒸馏——Swyx团队披露"Stolen Thoughts"攻击 | 来源:@swyx | 链接: | 仓库:无 | 论文: | 硬核点:加密thinking block共享密钥设计缺陷,弱模型可明文读强模型推理轨迹,涉OpenAI/Ant…
2026-08-17-2340-news-x-tech-radar
主题:前端模型文档 OCR 解析已到瓶颈,三代 GPT 精度提升 24pt 但成本涨 4 倍 | 来源:@jerryjliu0 | 链接: | 仓库:无 | 论文:无 | 硬核点:直接数据反驳"前沿模型 OCR 已商品化"观点,LlamaParse 对比基准数据可作 RAG/文档提取攻略素材 主题:Qwen 3.8 2…
2026-08-17-1140-news-x-tech-radar
扫描窗口:20260810 ~ 20260817(本周) 说明:本轮窗口硬核技术帖密度偏低,部分账号(X 月中淡出),已从严筛选。 主题:前沿模型隐藏推理 token 可被 1:1 提取——利用 API 漏洞验证billing token与真实推理步数一致 | 来源:@swyx | 链接: | 仓库:无 | 论文:无 …
2026-08-16-2340-news-x-tech-radar
本轮无干货候选(20260809 ~ 20260816 窗口内,硬核技术帖数量为零)。 @{omarsar0} · MASSRAG (ACL 2026 Findings, arxiv:2604.18509) · Apr 21 post · 多角色 RAG 框架论文,超出本轮窗口,留档参考 @{omarsar0} · "…
X 硬核干货雷达 · 2026-08-16
主题:Sakana AI Conductor——7B 模型用 RL 编排其他 LLM,ICLR 2026,递归拓扑解锁 testtime scaling | 来源:@omarsar0 | 链接: | 仓库:SakanaAI/Conductor | 论文: 2026) | 硬核点:Conductor/worker 路由是…
2026-08-15-2340-news-x-tech-radar
采集窗口:20260809 ~ 20260815 主题:DeepSeek Harness v0.1 — Cordis 插件化 Agent Harness(MIT, 106k★) | 来源:@omarsar0 | 链接: | 仓库:deepseekai/deepseekharness | 论文:无 | 硬核点:插件即一切…
X 硬核干货雷达 · 2026-08-15
主题:LlamaExtract Agentic Plus 发布——企业文档提取 SOTA,ExtractBench 4869 页/67 类/8 领域基准开源 | 来源:@jerryjliu0 | 链接: | 仓库:runllama/ExtractBench | 论文:无 | 硬核点:LlamaIndex 企业级文档提取…
2026-08-14-2340-news-x-tech-radar
主题:ExtractBench——LlamaIndex 推出企业文档提取基准(4869页/67类/8领域) | 来源:@jerryjliu0 | 链接: | 仓库:runllama/ExtractBench | 论文: | 硬核点:LlamaExtract Agentic Plus 凭95.6%综合准确率Pareto领…
2026-08-14-1140-news-x-tech-radar
主题:GPT5.6 Sol Ultra + Codex Desktop 单次构建完整 3D 游戏实录 | 来源:@simonw | 链接: | 仓库:simonw/raccoonheistcodex | 论文:无 | 硬核点:$23.28 API 成本明细(700K input + 32.5M cached + 148…
2026-08-13-2340-news-x-tech-radar
主题:CPT 持续预训练实战资源清单(Databricks 系) | 来源:@cwolferesearch | 链接: | 仓库:无 | 论文:无 | 硬核点:Aug 8 帖子整理了 CPT 做领域专用 LLM 的最佳实践资源,Databricks 方案含 PyTorch 实现细节,训练调参踩坑可参考,但属转发汇总非原…
2026-08-13-1140-news-x-tech-radar
主题:SSM 状态重计算——混合模型推理 2x 提速新解法 | 来源:@tri_dao | 链接: | 仓库:statespaces/mamba | 论文:无 | 硬核点:首创 RecomputeSSM 技巧——hybrid model(Qwen 3.5/Nemotron Ultra)decode 阶段不写回 SSM …
2026-08-12-2340-news-x-tech-radar
主题:LangChain Managed Deep Agents 正式 GA——纯 markdown/config 无代码部署生产 agent | 来源:@hwchase17 | 链接: | 仓库:langchainai/deepagents | 论文:无 | 硬核点:LangChain 生态从 Python API …
2026-08-12-1140-news-x-tech-radar
主题:@omarsar0 论 harness 工程决定 agent 工具调用行为而非工具数量 | 来源:@omarsar0 | 链接: | 仓库:无 | 论文:无 | 硬核点:harness 决定何时不调用工具,比堆工具数更重要——实操踩坑复盘,agent prod 落地必读 主题:@simonw Codex 月订阅开…
2026-08-11-2340-news-x-tech-radar
主题:MaplePreview 开源 20B 三元权重量化推理模型,Mac Mini M4 跑出 200+ tokens/s | 来源:@abacaj | 链接: | 仓库:deepgrove/maplepreview | 论文:无 | 硬核点:三元权重量化+边缘部署工程细节,IMO 级别推理 SOTA,量化实操参考价…
2026-08-11-1140-news-x-tech-radar
主题:Antidoom 训练法——消除推理模型 doom loop,doom 率 22.9%→1%,附开源训练代码与数据集 | 来源:@maximelabonne | 链接: | 仓库:liquidai/antidoom | 论文:无 | 硬核点:推理模型致命失败模式有系统性解法,且开源了完整训练流程和数据;可复现、可…
信源:X 硬核干货雷达 · 覆盖 12 账号
采集日期:20260810 · 时段:近 37 天 · 评分维度:实现技巧/性能优化/踩坑复盘/新工具用法/论文长帖 主题:GPT5.6 通过 Codex 自我优化,降低 20% 服务成本 | 来源:@simonw | 链接: | 仓库:无 | 论文:无 | 硬核点:模型自优化生产部署(重写 GPU kernel + …
2026-08-10-news-x-tech-radar
主题:LangChain Managed Deep Agents 发布——从 early langchain 到托管 agent 的演进路径 | 来源:@hwchase17 | 链接: | 仓库:langchainai/deepagents | 论文:无 | 硬核点:LangChain 官方首次把 deep agent…
2026-08-09-2340-news-x-tech-radar
主题:Prime Agent——自改进 RLM harness 支持编程式工具调用/多Agent消息/状态自改 | 来源:@omarsar0 | 链接: | 仓库:PrimeIntellect/primeagent 或 无 | 论文:无 | 硬核点:Agent harness 超过 model 成为性能瓶颈——Prim…
X 硬核干货雷达 · 2026-08-09 11:40
主题:FA4 算法重设计——Blackwell 上 attention 达 ~1600 TFLOPs(与 matmul 等速) | 来源:@tri_dao | 链接: | 仓库:DaoAILab/flashattention | 论文:无 | 硬核点:指数近似多项式 / 新 online softmax / 2CTA …
X 硬核干货雷达 · 覆盖 12 账号
扫描时间: 20260808 15:40 UTC 主题:condensejson 1.0/1.1:JSON 去重库,为 LLM 推理日志省存储 | 来源:@simonw | 链接: | 仓库:simonw/condensejson | 论文:无 | 硬核点:Python 库 + 替换对象机制实现 JSON 内重复数据压…
X 硬核干货雷达 · 覆盖 12 账号
扫描时间: 20260808 15:40 UTC 主题:LLM 0.32:可见推理追踪+OpenAI Responses API+服务端 provider 工具+内容寻址 SQLite 日志 | 来源:@simonw | 链接: | 仓库:simonw/llm | 论文:无 | 硬核点:Simon 自评"自项目发布以来…
2026-08-08-1140-news-x-tech-radar
主题:Agent 评估为什么比 LLM 评估难得多——环境状态校验、多轮交互、长时域数据稀缺性 | 来源:@cwolferesearch | 链接: | 仓库:无 | 论文:无 | 硬核点:系统性梳理 agent eval 特有的基础设施挑战(环境稳定性、状态校验开销、评估数据稀缺),对做 agent harness …