信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:Multi-Harness RL 完整指南——跨 Claude Code/Codex/OpenCode 联合训练 LFM2.5-2.6B | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2105796335584858466 | 仓库:adithya-s-k/RL_Envs_101 | 论文:无 | 硬核点:FineEnvs 实操指南,同一模型在不同 harness 中行为差异显著,联合 RL 训练 42%→54% 准确率,tool calls 减少 31%,攻略价值极高
-
主题:Just-in-Time OCR 两段式解析——免费/OSS 工具快筛 + 昂贵 VLM 精准 OCR | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2099534215973064764 | 仓库:无 | 论文:无 | 硬核点:代理处理临时数据房时全量预解析是错误范式,jit 两段式省 90% 以上 token 成本,LlamaIndex 已出最佳实践
-
主题:Agent RAG 精确溯源——word-level bounding box IoU≥0.5 才算正确 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:run-llama/ExtractBench | 论文:无 | 硬核点:VLMs 精确边界框预测普遍 <30%,LlamaIndex ExtractBench 严格评分标准揭示当前最强模型在 grounding 任务上的真实差距
-
主题:SAS 注意力稀疏化——硬 Top-K 梯度截断导致 previous selectors 退化为 dense attention | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2099511334987522298 | 仓库:无 | 论文:无 | 硬核点:注意力稀疏化的核心实现陷阱,解释为什么多数稀疏选择器无法真正学到选择性,踩坑复盘干货
-
主题:开源 Agent Harness 价值在于透明性,而非免费 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2102771721086673116 | 仓库:无 | 论文:无 | 硬核点:阅读小 harness 可看清 model response → tool call → error feedback → loop stop 的完整流程,开发者应把"build a reasoning model"黑箱变白箱
-
主题:Jev-as-a-Judge 全量 trace 评分——cheap enough to run on every trace | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2102087963517550667 | 仓库:无 | 论文:无 | 硬核点:评分成本降低后可对所有生产 trace 打分,自动化 safety/security regression 检测成为可能,swe-bench/harness 选型可参考
-
主题:Octrees as an Explicit 3D Language——离散八叉树替代光场模糊,空间归纳偏置给世界模型 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2106959958973759807 | 仓库:无 | 论文:https://huggingface.co/papers/2610.02... | 硬核点:3D 生成 one-turn 演示精美但 edit 三次后崩溃,核心问题在于 rasterized 模糊表征;八叉树提供显式空间先验,值得出论文解读攻略
-
主题:Scaling Trajectories via Recursive Self-Rewrite——将成功轨迹转化为 runbook 做 RL 训练数据 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2106960577071296651 | 仓库:无 | 论文:https://huggingface.co/papers/2610.02... | 硬核点:成功运行→runbook→训练数据的 pipeline;评论指出 divergence 误差会复合,需配合 evolutionary/genetic algo 增强,值得长帖解读
其余线索
- MCP tools for DAIR.AI——omarsar0 Oct 6 原帖附源码,x-agent-intelligence 插件 3 步搭建本地 X 情报流 feed,dair-ai/dair-academy-plugins 已在 watchlist
- OmniReasoning 音视频联合推理论文——@_akhaliq Oct 6,分享 huggingface paper page,新多模态方向
- Rollout-Marginal Distillation 长程视频生成——@_akhaliq Oct 5,自展式视频生成蒸馏,视频生成可关注
- LLM 对多模态模型拒绝有害请求的影响——omarsar0 Oct 6 NVIDIA NeurIPS 2026 论文,拒绝失败率最高提升 68.7%,agent 安全新议题
- In-Browser 微调 WebGPU+llama.cpp/wllama PoC——@maximelabonne Sep 6,WebGPU 运行 LLM 推理→LoRA 微调,浏览器端 fine-tuning 方向
- Ember-1 post-training 案例——@rasbt Sep 27,$xx million 预算建议从已有模型 post-training 而非从头预训练,Kimi K3→Ember-1 40% 降本案例