信源:X 硬核干货雷达 · 覆盖 12 账号
时间窗口:2026-09-21 ~ 2026-09-28
干货候选
-
主题:Ember-1 — Kimi K3 思考 token 压缩 40% 的推理专用模型 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2104326522354147793 | 仓库:无 | 论文:https://fireworks.ai/blog/ember-1 | 硬核点:Fireworks Research 基于 Kimi K3 的推理压缩方案,思考 token 减少 40%,同质量 / 35~50% 思考缩短无精度损失;首个公开规模化生产的 token 压缩推理模型,agent 成本优化可直接参考 API 定价策略
-
主题:onPanda — Token 级修正交互式对齐数据标注工具 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2102474190335234301 | 仓库:无 | 论文:https://huggingface.co/papers/2609.24983 | 硬核点:字节级修正交互标注范式,标注员定位首个错误 token → 截断重生成,释放 Panda-CVL 数据集;对齐数据构建 SOTA 流水线,可直接改造用于 agent trajectory 标注
-
主题:DualSQL — 共享骨干多 Agent RL 训练 Text-to-SQL | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2102402295682224325 | 仓库:无 | 论文:https://arxiv.org/html/2609.18135v1 | 硬核点:Google + Ohio State,schema linking + SQL generation 两 Agent 共享权重联合 RL;DualSQL-4B 在 Spider/BIRD-Dev 超越 Qwen3-8B 7~8 个点,多 Agent 协同 RL 的稀缺工程复现
-
主题:RoboDawn — VLM 视觉-语言模型迁移到机器人闭环控制 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2102474539620090152 | 仓库:无 | 论文:https://huggingface.co/papers/2609.22966 | 硬核点:视觉-语言模型迁移到物理机器人控制的 in-context learning 方案,离散 translation/rotation/gripper 命令接口;test-time scaling 随推理时长放松性能持续提升,工程性强
-
主题:Pruna-Qwen-Image-2.1 — 5~8 步图像生成/编辑 LoRA 适配器 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2103201617004949888 | 仓库:PrunaAI/Pruna-Qwen-Image-2.1 | 论文:无 | 硬核点:Qwen Image 2.1 从 50 步压缩到 5~8 步 (6.3× 加速),无需 CFG;Diffusers 生态即装即用,推理优化工程师直接可用的少步生成流水线
-
主题:ProgramDistill — 交互式 Web Apps 转化为可验证 SWE 任务 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2103952916545761536 | 仓库:microsoft/ProgramDistill | 论文:https://huggingface.co/papers/2609.18805 | 硬核点:Microsoft Research 开源,Web 交互 demo → 可验证参考引导 SWE 任务数据集;SWE 评测数据集构建新范式,browser-as-harness 思想可迁移到其他 agent 数据生成
-
主题:Jev 决策模型 & SemIf 开源替代方案 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2102084698985894352 | 仓库:无(相关:SemIf 等) | 论文:无 | 硬核点:Jev (decision model) 接口 + LangChain LangSmith 集成,SemIf 直接读 Qwen3.5-4B logit 无需微调,1.02s vs 5.33s 延迟对比;decision model 新品类工程落地,harness 层重要性讨论值得深入
-
主题:Log-probability 评分 vs LLM-as-a-Judge | 来源:@rasbt | 链接:https://x.com/rasbt/status/2103839035596611977 | 仓库:无 | 论文:https://aclanthology.org/2026.gem-main.55 | 硬核点:ACL 2026 GEM 论文,结构化输出/分类任务 log P(code|task) 可作无参考评分信号;claim-bearing token 过滤技巧,代码评测实用指南
其余线索
-
Contrastive Language Models (CLM) — @_akhaliq (Sep 23); System One / decision model 新品类,InfoNCE 双向 loss 连接 state-action,CLM-v0.1-8B (Apache 2.0) 已开源 https://huggingface.co/Contrastive-LM/CLM-v0.1-8B;与 Jev 路线平行,值得比较选型
-
ChessLFM 入驻 lichess 首页 — @maximelabonne (Sep 21); 230M 参数达 2000 Elo,Stockfish 蒸馏范式验证;最大规模开源国际象棋语言模型实验,开源模型压缩到 SOTA 棋力的代表性案例
-
Liquid AI Series B $200M @ $2B — @tri_dao (Sep 22); Greenoaks 领投,Index/Bain 参与;FlashAttention 作者创业公司里程碑,模型结构创新 (LFM) 路线持续
-
Opus 5.5 PDF 表格解析 ParseBench 93.9% — @jerryjliu0 (Sep 22); 比 Opus 5 提升 7%,LlamaParse Agentic Plus 质量持平;Jerry 补充"quiet failure 代价 > explicit flagging",踩坑复盘有实战价值
-
@cwolferesearch: RL 算法在 LLM 训练中的应用图谱 — Sep 24 长帖;RLHF/PPO/GRPO/RLVR 各代算法演进,LLM 训练方法论梳理,参考价值高但无新 repo
-
@swyx: decision model 新品类讨论 — Sep 22; System One 概念引入 (simonw + Jev 背景),AINews 切 Opus 5 为默认;观点性内容但品类框架值得关注