研究库 实战攻略
Guides · organized/guides

仓库攻略

244 篇 · 241 个项目 · Agent 智能体 · jay

Coding Agent Harness 设计实证研究:176 实验教我们什么 · 干货攻略
这篇论文(arXiv:2609.20804,2026 年 9 月 17 日)是首批对 Coding Harness 进行组件级拆解实证研究的工作之一。 论文作者(RunZe Fan 等,来自 UMass Amherst、Emory、UNC Charlotte 和 Zoom)构建了一个模块化的轻量 Coding Harness,将执行循环固定,仅对三个组件进行…
Agent 智能体 无(纯 arXiv 论文,无开源代码仓库) Jay 2026-09-22
Dicklesworthstone/skillranker · 上手攻略
SkillRanker(命令 sr)是一个独立运行的 Rust CLI 工具,核心作用是在 AI 编码代理(Claude Code、Codex 等)的技能库中,根据当前会话的实时上下文,智能挑选最适合下一步的技能。它由 TypeSafe.ai 的 Jev 模型提供决策引擎,支持 Claude Code Hooks 集成、结构化 JSON 输出、主动弃权(ab…
Agent 智能体 Dicklesworthstone/skillranker Stars 115 Jay 2026-09-21
Procedural Graphs:让 LLM Agent 自进化执行结构 · 干货攻略
Procedural Graphs(过程图)是 Google 团队(Yuxing Lu、Yicheng Chen、Shanchan Wu、Sercan Ö. Arık)2026 年 9 月 8 日发表在 arXiv(2609.09153)的论文提出的 LLM Agent 执行结构框架。 其核心思想类比清晰: 知识图谱(Knowledge Graph)→ 用(…
Agent 智能体 无(论文 arXiv:2609.09153,Google 团队,未见公开代码仓库) Jay 2026-09-21
GPT-6 Astra 编码 Agent 成本评测:$10/$50 定价与 Coding Agent Index 实测 · 干货攻略
GPT6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的旗舰模型,定位为「AI 工程师」级 Agent 主力引擎。本攻略聚焦其 API 接入成本 与 编码类 Agent 任务性价比,为有实际落地需求的开发者提供一份可复现的参考。 核心事实(均来自官方来源,详见「核验过程」): | 维度 | 数据 | ||| | API 模型名 | gp…
Agent 智能体 Jay 2026-09-20
RocYan98/CodexBoard · 上手攻略
CodexBoard 是一个 macOS 桌面应用,将项目任务看板与本机 Codex 连接起来。它的核心用途是:让你用看板(Kanban)的方式管理任务,把任务提交给本机 Codex 执行,然后在看板里实时查看进度、处理审批和补充信息——相当于给 Codex 加了一层任务管理层。 项目支持两种接入方式:Web 浏览器( HTTPS 登录) 和 飞书(Lark…
Agent 智能体 RocYan98/CodexBoard Stars 103 Jay 2026-09-19
vastsa/PI-Desktop · 上手攻略
PIDesktop 是一个本地优先(Localfirst)的 AI 编程 Agent 桌面工作空间。它的核心理念是:大多数编程 Agent 活在终端、编辑器插件或托管服务里,而 PIDesktop 给它们一个真正属于自己的独立桌面环境。 项目选用 Electron(前端界面)+ Rust Host Core(特权操作核心)+ pi Agent Sidecar…
Agent 智能体 vastsa/PI-Desktop Stars 4,401 Jay 2026-09-19
Jev Ultrafast · 极速浏览器 Agent 框架 · 干货攻略
Jev Ultrafast 是 browseruse 团队在 2026 年 9 月发布的一个开源浏览器 Agent 框架,核心创新是将 TypeSafe Jev 决策模型与动态索引式动作空间结合,实现超快决策循环。 与传统的截图+视觉推理路线不同,它用原子化 DOM 快照替代视觉输入:JavaScript 一次性读取页面可见控件(按钮、输入框、下拉框等),按…
Agent 智能体 browser-use/jev-ultrafast Jay 2026-09-19
多子 Agent 何时越少越好:并行收益递减实战手册 · 干货攻略
多子 Agent 并行存在收益递减边界——当并发子 Agent 数量超过某个阈值后,增加更多 Agent 不仅无法继续提升效果,反而会因协调开销、Token 浪费和上下文重叠导致整体效率下降。 核心反直觉结论: 来源分享者 @omarsar0(Omar Sánchez)是 AI 工程领域活跃的独立研究员,以梳理长文摘要和架构分析著称。 多 Agent 系统是…
Agent 智能体 Jay 2026-09-17
Just-in-Time Agentic OCR:两遍范式搞定临时数据房 · 干货攻略
JustinTime(JIT)Agentic OCR 是 LlamaIndex 联合创始人 Jerry Liu 在 2026 年 9 月提出的一种两遍文档处理范式,核心思想是: 不要对每个文档一开始就做昂贵的 VLMOCR,而是在需要的时候才精准放大(zoom in)到相关页面。 传统方案(全量 VLMOCR)的问题:贵、慢、没必要。JITOCR 的答案:先…
Agent 智能体 Jay 2026-09-17
NeoHorse-1:Qwen3.5 后训练递归自改进 Agent 原型 · 干货攻略
NeoHorse1 是 TokenRhythm 发布的一个 Agent 原生语言模型家族,包含 4B 和 9B 两个规模,均从 Qwen3.5 后训练而来,定位是「递归自改进(RSI)」路径上的初始原型。 官方将其描述为「agentnative」——模型从一开始就不是为通用对话设计的,而是专门针对工具调用、编码、Agent Harness 场景、指令遵循这四…
Agent 智能体 TokenRhythm/NeoHorse Jay 2026-09-16
Armur-Ai/Pentest-Swarm-AI · 上手攻略
Pentest Swarm AI 是一个基于真实群智(Swarm)架构的开源渗透测试引擎,由 Go 语言编写,支持 Claude、GLM、Qwen、DeepSeek、Gemini、Ollama 等任意具备 functioncalling 能力的 LLM。与传统多 Agent 工具「单 Planner 按固定顺序调用各阶段」不同,Pentest Swarm A…
Agent 智能体 Armur-Ai/Pentest-Swarm-AI Stars 2,492 Jay 2026-09-13
xberg-io/xberg · 上手攻略
Xberg 是用 Rust 编写的多格式文档智能提取引擎,下一代 Kreuzberg v4。声称支持 107 种文档格式 / 141 种文件扩展名 / 371 种编程语言,提供 15 种语言绑定(Python、Node.js、Rust、Go、Java、C#、Ruby、PHP、Elixir、Dart、Swift、Zig、WASM、Kotlin、C FFI),零…
Agent 智能体 xberg-io/xberg Stars 9,362 Jay 2026-09-12
ai4s-research/open-science · 上手攻略
Open Science Desktop(简称 OSD,原名"Open Science",v0.5.2 为当前最新版)是一个本地优先、模型无关的 AI 科研工作台,面向 macOS、Windows 和 Linux。它用 Tauri 构建桌面外壳,内嵌 OpenCode 运行时,通过 MCP 协议连接科学数据库和 agent 技能,可以完成从文献调研、实验设计…
Agent 智能体 ai4s-research/open-science Stars 1,621 Jay 2026-09-10
agentrhq/webcmd · 上手攻略
Webcmd 是一个面向 AI 编程 agent 的自学习浏览器基础设施。它的核心思路很直接:让 agent 在真实浏览器中完成任务,同时把网站的结构知识(sitemap、action space、pitfalls)留在本地,下次同类任务不再重复探测,直接从记忆启动。据 README 描述,理论上可将浏览器 agent 的 token 消耗降低 90%。 它…
Agent 智能体 agentrhq/webcmd Stars 1,591 Jay 2026-09-10
neomjs/neo · 上手攻略
Neo.mjs 是一个自演进软件有机体——一支专业端到端 AI 工程团队,跨模型(Claude / Gemini / GPT 等) swarm 协同,通过 Neural Link(神经链接)进驻实际应用,在内存核心(Memory Core)、知识库(Knowledge Base)、Native Edge Graph、A2A 协调层上自主完成从构思到构建到交叉…
Agent 智能体 neomjs/neo Stars 3,275 Jay 2026-09-08
AI Research Preference Models:让 Agent 在 GPU 预算内选对跑哪个实验 · 干货攻略
AI Research Preference Models(RPMs)是 Meta FAIR 团队(联合牛津大学、UCL)提出的一种新方法,核心问题是:AI 研究 Agent 能提出远多于能跑实验的候选方案,但 GPU 预算有限,如何在跑之前就知道哪个最值得跑? RPM 的思路是:不预测绝对分数(论文发现 LLM 在预测具体指标上不可靠),而是用预训练冻结的…
Agent 智能体 Jay 2026-09-08
HarnessDev:LLM 能否自己构建并迭代 Agent Harness? · 干货攻略
⚠️ 仓库说明:原帖链接指向 ByteDanceSeed/HarnessDev,但该 GitHub 仓库不存在(404)。官方资源为 arXiv 论文及项目页,以下内容均来自这两个来源。 HarnessDev 是 ByteDance Seed(联合新加坡理工大学、佐治亚理工、MAP、TokenWave.AI 等机构)于 2026 年 9 月 1 日发布在 a…
Agent 智能体 无(项目页 https://self-developing-agents.github.io/;X 帖所附 ByteDance-Seed/HarnessDev 返回 404,核验后该仓库不存在,以官方项目页为准) Jay 2026-09-07
bahayonghang/academic-writing-skills · 上手攻略
academicwritingskills 是一个面向学术写作后期的 AI 辅助工具集,基于 Agent Skills 协议 安装,专为已存在初稿的论文提供「审稿人视角」的诊断与精修。不是从零写论文,而是对已有稿件做格式校验、文献核查、语法抛光、去 AI 味编辑和同行评议式审查。 覆盖 LaTeX(英文 / 中文学位论文)、Typst 和 PDF 三种格式。…
Agent 智能体 bahayonghang/academic-writing-skills Stars 484 Jay 2026-09-06
SenteLabsAI/OpenExecutive · 上手攻略
OpenExecutive 是一个 AI 虚拟高管团队系统——用一套系统扮演你公司的完整高管层(CSO、CFO、CHRO、GC、COO、CMO、CPO、董事会秘书),用户始终只和一个连贯的"Executive"声音对话,内部则由 8 个专业 Agent 并行协作,从 ChromaDB 检索知识、SQLite 记录决策记忆、Anthropic Claude 作…
Agent 智能体 SenteLabsAI/OpenExecutive Stars 3,812 Jay 2026-09-06