信源:X 硬核干货雷达 · 覆盖 12 账号

干货候选

  • 主题: HarnessDev: LLMs 可自建并迭代 Agent Harness(ByteDance Seed) | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2095170896407548190 | 仓库:ByteDance-Seed/HarnessDev | 论文:https://arxiv.org/abs/2609.01437 | 硬核点:评分焦点从任务输出转向"harness 本身"——Creation 阶段从种子+少量 case 构建完整执行系统,Evolution 阶段用下游反馈迭代改进;6 个 Creator LLM × 4 领域 × 5 基准揭示自建 harness 在 code/search/research 仍落后成熟人工系统,踩坑复盘价值高

  • 主题: ByteDance Seed 再放大招——自进化 Agent Harness 基准 HarnessDev | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2095668039404728351 | 仓库:ByteDance-Seed/HarnessDev | 论文:https://arxiv.org/abs/2609.01437 | 硬核点:AK 同步策展,附 HF Papers 链接;核心洞察:agent 构建自己的 harness,但"进化增益不稳定且依赖运行时模型"——外层迭代框架踩坑必读

  • 主题: Repo-To-Skill: 将 GitHub 仓库蒸馏为 AI4AI Skills(arXiv 2609.02749) | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2095667775830434099 | 仓库:无 | 论文:https://arxiv.org/abs/2609.02749 | 硬核点:AREX-Skill Library 从 1000 个 ML 仓库蒸馏 5000+ 可验证技能,Claude/GPT 复用已付费知识而非每次 token 重发现;把 repo 知识变成可执行策略的流水线,攻略价值高

  • 主题: Gemini 3.8 Flash / 3.8 Flash Cyber 效率 chart 分析——Pareto 最优边界 | 来源:@omarsar0 | 链接:https://x.com/omarsar0/status/2095177610930098670 | 仓库:无 | 论文:无 | 硬核点:elvis 实测 chart 解读:Flash 性价比图表极清晰,Flash Cyber 在 code patching 达到 Pareto frontier;模型选型实战参考

  • 主题: Astra 是"循环 transformer"?Raschka 实测数据辟谣 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2095871852711153742 | 仓库:无 | 论文:无 | 硬核点:GPT-6 Astra token 减少是因为模型更聪明(更大、更多训练),非显式隐藏 reasoning tokens;GPT-5.6 Sol 比 Luna 少 46% output tokens 无人说隐藏——数据打脸舆论

  • 主题: Build a Reasoning Model from Scratch 视频 R2: KV Caching + Text Generation 实战 | 来源:@rasbt | 链接:https://x.com/rasbt/status/2096596372661113294 | 仓库:无 | 论文:无 | 硬核点:2 小时 YouTube 实战:从零实现 Qwen3 加载、logits 生成、greedy decoding、streaming generator、KV caching 原理+代码;PyTorch from scratch,工程感极强

  • 主题: ChatGPT 桌面 App 捆绑完整 LibreOffice——磁盘占用发现 | 来源:@simonw | 链接:https://x.com/simonw/status/2094864223683903800 | 仓库:无 | 论文:无 | 硬核点:simonw 发现 ChatGPT desktop app(曾名 Codex)在 ~/.cache 隐藏文件夹塞了整套 LibreOffice;磁盘清理/安全审计视角,踩坑向

  • 主题: Deep Agents: Compaction 减少送往模型的数据而非擦除底层工作历史 | 来源:@hwchase17 | 链接:https://x.com/hwchase17/status/2096285996304433248 | 仓库:无 | 论文:无 | 硬核点:LangChain Deep Agents 上下文管理哲学:工具结果太大写 filesystem,大会话把旧消息 offload;与 OpenAI Astra 的"隐藏 reasoning tokens"形成对比——架构设计思路异同值得写攻略

其余线索

  • 主题: CoGR: Query-Item 双向关键词生成器 RL 共进化(Apple, arxiv 2609.00xxx) | 来源:@_akhaliq | 链接:https://x.com/_akhaliq/status/2095668374437306641 | 仓库:无 | 论文:无 | 硬核点:仅优化 query 端的Retrieval 方法太局限;CoGR 让 query 和 item 两侧 co-evolve,LLM + RL,Apple 团队

  • 主题: GPT-6 Astra 97.2% 短文档 / 90.6% 中文档 SOTA——LlamaIndex ParseBench benchmark | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2096258549131165746 | 仓库:无 | 论文:无 | 硬核点:强 benchmark 数据,但平均每页 11c(10 倍 LlamaParse 成本方案),长文档仅 31.7%——工程落地性价比需权衡

  • 主题: Claude Fable 5.1 系统提示词更新要点:不再复现歌词、不画版权角色 | 来源:@simonw | 链接:https://x.com/simonw/status/2095362839792046181 | 仓库:无 | 论文:无 | 硬核点:simonw 实测 Fable 5.1 vs Fable 5 系统提示词差异;踩坑点:版权内容限制变严,攻略需注意

  • 主题: LlamaParse Extract Turbo——3.7 秒/页提取,4 倍速提升 | 来源:@jerryjliu0 | 链接:https://x.com/jerryjliu0/status/2095622647375651100 | 仓库:无 | 论文:无 | 硬核点:产品发布,4 倍速但保持精度;LlamaIndex 工程优化细节

  • 主题: WebGPU 浏览器内微调 LLM——llama.cpp / wllama PoC | 来源:@maximelabonne | 链接:https://x.com/maximelabonne/status/2096456605076476239 | 仓库:无 | 论文:无 | 硬核点:Maxime 点评"In-browser fine-tuning is coming";WebGPU inference 之后微调也进浏览器,LoRA next——技术演进路线信号