信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:Jev-as-a-Judge——LangChain 把决策模型 Jev 接入 LangSmith,1/80000 成本匹配人类标注者 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2101671063272796549 | 仓库:无 | 论文:无 | 硬核点:Typ eSafe AI Jev 是 System One 语义判别器(typed answers 替代 LLM 生成式判别),在 500 traces 上与人类标注一致且延迟/成本低 4 个数量级,批量生产 eval 必备
-
主题:SAS——用 LM loss 端到端训练 Attention selector 选 context,tight 预算下推理/长上下文任务大幅超越 Top-K 稀疏基线 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2099511334987522298 | 仓库:无 | 论文:https://arxiv.org/abs/2609.13141 | 硬核点:连续门控替代 hard Top-K selection,解决了 attention 稀疏化梯度阻断问题,triton kernel 集成 FlashAttention,长 context/agentic task 落地可期
-
主题:Datasette 安全补丁——Cl air-de-fune AI ensemble(Claude Fable 5.1 + GPT-5.6 + GPT-6 Astra)协同审计发现 permission 隔离 bug,human/AI 分工分工验 bug 工作流 | 来源:@simonw | 链接:https://simonwillison.net/2026/Sep/11/datasette-security | 仓库:simonw/datasette | 论文:无 | 硬核点:AI ensemble 跑安全审计的新范式——一人建测一人修,人类终验;安全补丁工作流可复用到其他开源项目
-
主题:MOPD——Multi-Teacher On-Policy Distillation:单学生模型用 on-policy reverse-KL 从多个教师蒸馏吸收能力(coding/math/reasoning),2026 后训练新范式 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2095256315476000817 | 仓库:无 | 论文:https://arxiv.org/abs/2606.30406 | 硬核点:从 OPRD → MOPD → D³-MOPD → Open-MOPD 已成 2026 论文系列主流路径,多教师路由是 agent/llm post-training 必跟进技术
-
主题:Top Models For Your Hardware 2026——实测不同显存档位可用模型,LFM-2.6B CPU 跑树莓派,边缘推理性价比指南 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2093448949223088360 | 仓库:无 | 论文:无 | 硬核点:Liquid AI LFM 架构实测数据,CPU-first 设计选择有说服力;边缘/低显存场景的实用选型参考
-
主题:Jerry Liu——2026 做 PDF agent 最被低估的技术:提供精确 grounding 回溯到源文本,而非只给 page number | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2089710424388202565 | 仓库:无 | 论文:无 | 硬核点:文档 RAG/agent 的 grounding 细粒度问题;exact text citation 比 page reference 对幻觉 reduction 效果更显著,工程实现成本低
-
主题:Jerry Liu——Filesystem 是 2026 agent 与文档交互的新默认抽象(新的 RAG stack),高性能内存文件系统替代传统 embedding 检索 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2049661223420223492 | 仓库:无 | 论文:无 | 硬核点:agent 本地文件交互 → 云端文档管控的 paradigm shift;in-memory FS + semantic层面的新设计模式
-
主题:Harrison Chase——Agent auth handling 是越来越 hard 的部分:agent 以自身行动后,log 无法区分谁的 intent,行为日志不可信 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2097443947161243902 | 仓库:无 | 论文:无 | 硬核点:生产 agent 系统 audit trail 的核心挑战;intent attribution 问题是安全合规绕不过去的工程坑
其余线索
- Simon Willison 整理 Claude Fable 5.1 实测笔记(navier-stokes 故事 + OpenAI 百万大奖问题),AI 写代码 + 自动化分析工作流:https://x.com/simonw/status/2097474703380365698
- Sebastian Raschka:LoRA adapters 在 2026 年仍然 strong,benchmark 表现持续验证 adapter 路线可行性:https://x.com/rasbt/status/2081374704753950742
- AK 分享 JEPA-Anything(Phi AI Labs)——predicting next world vs predicting next word,世界模型跨不同环境的泛化:https://alphaxiv.org/abs/2609.20800
- Cameron Wolfe:continual pretraining 做领域专用 open LLM 的最佳实践(deep reading 笔记):https://x.com/cwolferesearch/status/2086203104094257642
- Anton(@abacaj):K3 模型自我修正能力强但价格低,Claude Opus 5 浏览器自动化体验强:https://x.com/abacaj/status/2089932375245357119
- AK 分享 Apodex 1.1——Scaling Agentic Intelligence for Complex Work,Microsoft paper,多文件 refactor scaling 验证:https://x.com/_akhaliq/status/2092269176710631758