信源:X 硬核干货雷达 · 覆盖 12 账号
干货候选
-
主题:Agent 评估为什么比 LLM 评估难得多——环境状态校验、多轮交互、长时域数据稀缺性 | 来源:@cwolferesearch | 链接:https://x.com/cwolferesearch/status/2083588813675274301 | 仓库:无 | 论文:无 | 硬核点:系统性梳理 agent eval 特有的基础设施挑战(环境稳定性、状态校验开销、评估数据稀缺),对做 agent harness 的人来说是难得的全局复盘长帖,值得写评测设计攻略
-
主题:DeepSeek V4-Flash 基准任务成本比 Fable 低 105 倍,但 per-task 成本未必更低(多轮 turn 更多)——omarsar0 拆解误导性定价指标 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2082044549733056861 | 仓库:无 | 论文:无 | 硬核点:用 turn 数和 per-task 总成本拆穿"便宜 105 倍"宣传,教开发者如何正确评估推理成本,值得写成本估算攻略
-
主题:LFM2.5-Encoder 双发布——230M/350M 双规格,双向编码 + 长 context CPU 推理比 ModernBERT-base 快 3.7 倍 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne | 仓库:liquidai/lfm | 论文:无 | 硬核点:Liquid AI 近期最实诚的 benchmark 长帖,实测数字翔实,是做本地推理/端侧部署值得参照的评测基线,值得写速度优化攻略
-
主题:Multi-Agent Protocol Distillation:将闭源模型能力蒸馏到开源的方案,bridge distribution gap | 来源:@_akhaliq | 链接:https://x.com/_akhaliq | 仓库:无 | 论文:https://huggingface.co/papers/2607.24... | 硬核点:多 agent 蒸馏路线图清晰,huggingface.co/papers 有完整论文页,适合写蒸馏实操攻略
-
主题:StateAct:program state abstraction 在 pixel-level computer-use agent 之前做 action planning,提升长时域 agent 稳定性 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq | 仓库:无 | 论文:https://huggingface.co/papers/2607.22... | 硬核点:StateAct 是computer-use agent 领域的新信号,planning 层面的结构化抽象有实操价值,适合写 agent 架构攻略
其余线索
- @abacaj Jul 26 帖:"One shot"实际是两周对话——吐槽"一次搞定"宣传与真实多轮交互的落差;非技术帖,但观点对理解 agent 能力边界有参考价值
- @simonw Jul 10 帖:Atlas 退役 → AI 增强浏览器赛道或终结,隐私/安全沙盒问题无法解决;技术观点帖,有架构思考价值
- @jerryjliu0 Apr 28 帖:Filesystem 是 2026 agent 默认抽象(新 RAG 栈),文档 agent 的核心是 sandbox 语义 + git 版本化;偏产品抽象,配套 Mesa 工具介绍,趋势参考价值