信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题:MCP 2.0 无状态协议深度解析+mcp-explorer/datasette-mcp 实战踩坑 | 来源:@simonw | 链接:https://x.com/simonw/status/2083330693313220615 | 仓库:simonw/mcp-explorer, simonw/datasette-mcp | 论文:无 | 硬核点:MCP 2.0 无状态化是 2026 年协议层最大变化;simonw 亲测 Datasette 接入踩坑,含服务端工具链与日志设计细节,可直接抄作业

  • 主题:Antidoom 训练法——消除推理模型 doom loop,doom-loop 率 22.9%→1% | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2074495376204210388 | 仓库:liquidai/antidoom | 论文:无 | 硬核点:推理模型部署必遇的 doom loop 问题,开源训练代码+数据集,实用价值极高

  • 主题:LFM2.5-Encoder 系列——双向编码器 CPU 高效推理,3.7x 快于 ModernBERT | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2082122012726608345 | 仓库:liquidai/lfm | 论文:无 | 硬核点:Liquid AI 新 encoder 模型+多语言 tokenizer 加倍(65K→128K)实操细节,Jul 29 贴出 recipe

  • 主题:Hybrid Search 生产踩坑——Slack 线程分块/实时同步/guardrails 工程细节 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2078537490932384136 | 仓库:无 | 论文:无 | 硬核点:纯向量检索对精确匹配失效;生产级 hybrid search 调参、chunking heuristics、权限 guardrails 细节

  • 主题:IFStruct 开源——LLM 结构化输出/Schema Following 系统性评测基准 | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2071959319923380481 | 仓库:cleanlab/structured-output-benchmark | 论文:无 | 硬核点:structured output 是 2026 年 LLM 落地痛点,IFStruct 提供系统性评测方法论,值得写攻略

  • 主题:ReplaySSM——混合模型 SSM 状态重计算技巧,解锁 spec decoding 加速 2x | 来源:@tri_dao | 链接:https://x.com/tri_dao/status/2066518563184365953 | 仓库:无 | 论文:无 | 硬核点:混合模型(Nemotron-3/Qwen3.5)部署必读,状态写回→重计算 trade-off 实测,Jun 15 贴

  • 主题:弱到强泛化——On-Policy 蒸馏让小模型从大模型自我改进 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2077170804693803266 | 仓库:无 | 论文:https://arxiv.org/abs/2607.XXXXX | 硬核点:弱-to-Strong Generalization 新进展,on-policy 路线比静态标签转移更有潜力,Jul 14 贴

  • 主题:OSWorld2.0 发布——长程真实世界任务上评测 Agent 计算机使用能力 | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2071994666380038491 | 仓库:无 | 论文:https://huggingface.co/papers/osworld2 | 硬核点:Agent 评测基准重大更新,覆盖真实桌面操作长程任务,Jul 30 贴

其余线索

  • @jerryjliu0 Jul 14: Retrieval Harness in LlamaParse——2026 版 RAG over documents 工具集,hybrid retrieval/list files/file grep/file read 组合工具(仓库 run-llama/legacy 已在 watchlist)
  • @cwolferesearch Jul 28: 工具调用效率作为 emergent 能力的讨论,弱标签信号与规划能力关联
  • @rasbt Jul 10: GPT-5.6 Luna/Terra/Sol effort 设置对比图——token 效率与模型选择实操参考
  • @_akhaliq Jul 22: DataFlow-Harness——可编辑 LLM 数据流水线 DAG 平台(仓库 OpenDCAI/DataFlow-Harness 已在 watchlist)
  • @_akhaliq Jul 20: RESOURCE2SKILL——从多模态资源蒸馏可执行 Agent 技能,HF paper page
  • @_akhaliq Jul 27: Kimi K3 in Claude Code via HF Claude——国产模型接入 Claude Code 工具链实测