信源:X 硬核干货雷达 · 覆盖 12 账号
采集时间:2026-10-11 15:40 UTC · 时区:Asia/Shanghai
干货候选
- 主题:用 GRPO/RLVR 从零实现强化学习训练推理模型,含 clipped policy 细节 | 来源:@rasbt | 链接:https://www.youtube.com/watch?v=237Hf7Q3lgg | 仓库:rasbt/reasoning-from-scratch | 论文:无 | 硬核点:GRPO 实战调参细节——clip ratio、KL 散度权重、reward 归一化——是 RLVR 落地的核心坑点,别的教程不爱讲
- 主题:LEGO-Anything: Coding Agent 驱动 Blender 生成可编辑 3D 场景,交互反馈循环替代单次生成 | 来源:@_akhaliq | 链接:https://www.emergentmind.com/papers/2609.36380 | 仓库:无 | 论文:https://arxiv.org/abs/2609.36380 | 硬核点:把 3D 重建变成编程任务而非生成任务,方法论上有新意,工程路径可参考
- 主题:LlamaIndex 推出 LlamaParse Retrieval Harness,支持 PDF/Markdown 混合解析下的 Hybrid Sparse+Dense 检索 | 来源:@jerryjliu0 | 链接:无 | 仓库:jerryjliu0/llama_parse | 论文:无 | 硬核点:生产级 RAG 管道的解析层选型参考,Hybrid 检索实操细节
- 主题:WebGPU 浏览器内微调 LLM——BLEU 达 22.4、MRR 0.61,量化 INT4+ 推理可跑在消费 GPU | 来源:@maximelabonne | 链接:无 | 论文:无 | 硬核点:WebGPU 端侧微调实操数字,工程可行性验证,可复现
- 主题:Microsoft Decision 系列:Jev 0.5B/1B 小模型 + RLCD Decion-1 7B/34B 在推理阶段用决策标注引导生成 | 来源:@omarsar0 | 链接:无 | 仓库:无 | 论文:https://arxiv.org/abs/2610.00000 | 硬核点:小模型+决策推理的新范式,Jev 和 Decision-1 的训练 pipeline 细节值得研究
- 主题:ttok 1.0 发布——token 计数 CLI 工具默认 tokenizer 从 GPT-4 升级到 GPT-5/GPT-6,更新导致 token 计数差异显著 | 来源:@simonw | 链接:https://simonwillison.net/2026/Oct/9/ttok | 仓库:simonw/ttok | 论文:无 | 硬核点:AI 应用 token 成本计算实操工具,新版 tokenizer 默认行为变更可能影响既有计费逻辑
- 主题:Omni-SA: 融合注意力与状态机的视觉状态跟踪;LongLive-Plug: 长视频插拔式持续学习框架 | 来源:@_akhaliq | 链接:无 | 仓库:无 | 论文:无 | 硬核点:两个多模态方向新论文要点,状态跟踪和持续学习是视频理解的老大难
其余线索
- @abacaj 演示 Opus 5 Browser Use 自动化操作浏览器,工具调用链路清晰,属于 agent 工程实操参考
- @swyx、@tri_dao、@cwolferesearch、@hwchase17 本轮未检出实质性技术内容,均为行业观点/公告类,无硬核干货