本篇来自 @omarsar0(elvis)的实操教程,基于 LangChain 官方博客上 Sydney Runkle 的同名文章,用 Pi SDK(TypeScript AI Agent 开发工具包)从零实现一套完整的三段式 Agent Harness,并将 Jev(TypeSafe AI 的决策模型)接入每个决策节点。 Pi SDK(github.com…
仓库攻略
405 篇 · 395 个项目 · jay · Agent 智能体
Hister 是一个本地运行的私人搜索引擎,用于索引和检索你访问过的网页、书签和本地文件。全程数据保存在你自己控制的机器上,不需要任何云端账号或第三方服务。 通过浏览器插件自动收集页面内容,配合 Hister 内置的查询语言或 MCP 接口,可以从 Web UI、终端或 AI 助手侧查询你的个人知识库。 日常上网我们会访问大量页面,但浏览器自带的搜索功能只能…
WebCodex 是一个本地开发环境桥接工具,让云端 AI Agent(如 ChatGPT、Claude)直接使用你本机已有的真实代码仓库、Git 工作区和开发工具链,而不需要把代码上传到任何托管服务或云端沙箱。 核心定位是把「AI 客户端(MCP)」和「你的真实机器」连接起来:AI 负责理解、修改、审查代码,运行测试和命令;代码、编译器、Git 历史都在你…
代表攻略
用 Pi SDK + Jev 构建自定义 Agent Harness · 干货攻略
Pi SDK(earendilworks/pi)是 earendilworks 出品的 TypeScript Agent 开发工具包,包含多个可独立使用的包: | 包名 | 用途 | ||| | @earendilworks/piagentcore | Agent 运行时,含工具调用与会话状态管理 | | @earendilworks/piai | 统一 L…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
earendil-works/pi
Stars 82,886
代表
earendil-works/pi
Stars 82,886
ProgramDistill 是微软研究院(Microsoft Research Montréal)与韩国科学技术院(KAIST)于 2026 年 9 月发布的代码智能基准。它的核心思路不同于传统 SWEbench——不依赖 GitHub Issue 或人工撰写的任务描述,而是让 AI Agent 通过与一个功能完整的参考应用交互,自行推断出缺失的功能,再在…
onPanda(全称 onPolicy alignment data annotator)是 StepFun 与厦门大学联合开源的交互式 LLM 对齐数据标注工具,论文链接 arXiv 2609.24983。核心创新是token 级修正(tokenlevel correction)交互范式——标注员不再手动编辑完整回复,而是在模型生成过程中定位第一个出错 t…
Ember1 是 Fireworks Research(Fireworks AI 的研究团队)于 2026 年 9 月 23 日发布的推理专用模型,本质是对 Moonshot AI 的开源推理模型 Kimi K3 做后训练压缩——让它学会用更少的思考 token 到达同等质量的答案。 这不是新架构,也不是新基座模型,而是 K3 的一次 specialized…
本攻略解读 @simonw(Simon Willison)于 2026 年 9 月 15 日发布的实操教程,展示如何用纯浏览器原生 API(Web Audio API + WebSocket)零依赖接入 Google Gemini 3.8 Live 语音对话 API,全程不用任何第三方 npm 包。 分享者 Simon Willison 是 Python/W…
一篇 2026 年 8 月 10 日提交的学术论文(arXiv:2608.09867,cs.CR),由来自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Snyk 的研究人员撰写。论文发现:Anthropic、OpenAI、Google …
Jev Social 是一个浏览器 grounded 社交媒体研究智能体,将 AI 决策模型(Jev)与真实 Chrome 浏览器操作(socai CLI)配对,对 Instagram、TikTok、LinkedIn 三个平台执行可验证的社交研究任务。Jev 负责每一步「搜索 / 打开某个主页 / 阅读某条评论 / 下载视频 / 结束」的选择决策;socai…
2026 年 8 月 10 日,一支来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 的研究团队(含 Alexander Panfilov、David Schmotz、Ilia Shumailov 等人)在 arXiv 发布论文 "St…
JEPAAnything 是一个领域无关(domainagnostic)的通用世界模型学习框架,发表在 arXiv (2609.20800),由 GenVerse 团队开源。它的核心创新叫做 Orthogonal Predictive Factorization(OPF,正交预测因子分解)——把 JEPA(联合嵌入预测架构)的单一目标表征替换为一组互补的、正…
AI Engineer World's Fair(AIEWF)是全球规模最大的 AI 工程垂直会议,2026 年已于 6 月 29 日至 7 月 2 日在旧金山 Moscone West 举行。2026 年是分水岭:大会规模达 6,000+ 工程师、300 位演讲嘉宾、29 个分论坛、100+ 参展商——从三年前「AI Agent」仅占 1 个 track,…
JITAgent(arXiv:2608.25593)是一个任务时动态生成 Agent 架构的研究系统。与其给所有任务预配置一套固定的 Agent 框架,JITAgent 用一个 27B 的元模型(metamodel)在看到任务时才生成专属 harness——包含 memory(记忆)、planning(规划)、action(执行)、capability(工具…
集体失控(Collective Loss of Control) 是 2026 年 9 月腾讯朱雀实验室(Tencent Zhuque Lab)发表的一篇论文(arXiv:2609.18460)中提出的概念,用于解释多 Agent 系统如何从一次局部偏差演化为集体性故障。论文的核心理论框架将多 Agent 失控建模为流行病传播——三个阶段:意外突变(Muta…
Visual Grounding(视觉定位)是 2026 年 PDF Agent 工程中最重要的却被严重低估的能力。它指的是:给定一段文本描述,模型需要找到该描述对应的图像/文档区域——具体到 bounding box(边界框)、页码、词级别或行级别的精确位置。 在 PDF Agent 场景下,Visual Grounding 意味着:Agent 回答"这份…
metapipe 是一个基于 Claude Code 的端到端系统综述(Systematic Review)与元分析(MetaAnalysis)自动化 pipeline。你给一个研究主题,Claude Code 自动完成从文献检索、筛选、数据提取、统计分析到生成符合期刊格式的手稿,整个过程模块化、可重现、留有 5 个强制人工决策点。 核心逻辑:用 Claud…
Nimble 是一个本地运行的决策模型,基于 Qwen3.59B 微调而来,主打「给一段文字 + 一个 schema,立刻返回一个带概率的typed decision」——不做推理过程、不生成文本,直接从 logits 读出各候选答案的概率,返回确定类型的结构化结果。 核心灵感来自 TypeSafe 的商业产品 Jev(System One 决策路径),但 …
2026 年 9 月,LangChain 正式集成 TypeSafe AI 的 Jev——一个非传统 LLM 的"System One"判决模型。Jev 不生成文本,而是接收一段状态(state)和若干结构化问题,返回置信概率和分类决策。LangChain 通过 langchaintypesafe 包将 Jev 接入 agent harness,为两个高频决…
DeepSeekV4.1Flash 是 DeepSeek 于 2026 年 9 月 10 日 正式发布的开源多模态 MoE 大模型,是 DeepSeek 新架构家族的最小成员。它在 9 月 14 日已接管原 deepseekv4pro 的全部流量,成为 DeepSeek API 的主力模型。模型以 MIT 协议开源权重,同时通过 DeepSeek 官方 AP…
代表攻略
Skill Entropy:衡量并训练 LLM 跨技能切换能力 · 干货攻略
Skill Entropy 是普林斯顿大学(联合 CMU、UToronto、UIUC、Stanford、Oxford)团队提出的一套跨技能长程推理评测与训练框架,包含三个核心组件: 1. Skill Entropy(技能熵):一种度量技能切换难度的有向成对指标。当参考模型(Claudeopus4.7)分别处理两个技能时表现良好,但在连续执行两者时失败,则该技…
AgentSky(agentsky.dev)是 2026 年上线的世界首个 Agent Market(Agent 聚合分发平台),核心理念是「把 OpenRouter 对模型的作用复制到 Agent 层」——用一张 API key 统一接入 Claude Code、Codex、Hermes、OpenCode、Kimi Code、OpenClaw 等多款主流 …
这篇论文(arXiv:2609.20804,2026 年 9 月 17 日)是首批对 Coding Harness 进行组件级拆解实证研究的工作之一。 论文作者(RunZe Fan 等,来自 UMass Amherst、Emory、UNC Charlotte 和 Zoom)构建了一个模块化的轻量 Coding Harness,将执行循环固定,仅对三个组件进行…
Stellar Colosseum 是 Google Research 推出的一种多 Agent 协作 Harness 系统,用于在数学与理论计算机科学领域执行长程研究任务(longhorizon research)。由 Honghao Lin、David P. Woodruff(cofirst authors)、Yuan Deng、Jieming Mao、…
SkillRanker(命令 sr)是一个独立运行的 Rust CLI 工具,核心作用是在 AI 编码代理(Claude Code、Codex 等)的技能库中,根据当前会话的实时上下文,智能挑选最适合下一步的技能。它由 TypeSafe.ai 的 Jev 模型提供决策引擎,支持 Claude Code Hooks 集成、结构化 JSON 输出、主动弃权(ab…
Procedural Graphs(过程图)是 Google 团队(Yuxing Lu、Yicheng Chen、Shanchan Wu、Sercan Ö. Arık)2026 年 9 月 8 日发表在 arXiv(2609.09153)的论文提出的 LLM Agent 执行结构框架。 其核心思想类比清晰: 知识图谱(Knowledge Graph)→ 用(…
SoLPi(Scaling of Language — Pi)是 NVIDIA NVlabs 开源的一个 Pi Agent 引擎扩展包,通过四个可插拔的 Token 节省机制,在保持原有任务完成质量的前提下,大幅削减长时运行编码 Agent 的 token 流量和 API 成本。 它不是一个独立的 Agent,而是以插件形式叠加在 Pi(@earendilw…
AI Model World(大模型世界)是一个把 500+ 大模型可视化成像素小镇的互动网站。每个模型是某家厂商"小屋"里的一个像素角色,网站首页八块领奖台分别标注"今日最聪明""最会编程""最划算""最便宜""记性最好""最新发布""国内最强""开源最强",三秒扫完当天格局。背后数据来自 models.dev、Epoch AI、LiveBench、Hug…
GPT6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的旗舰模型,定位为「AI 工程师」级 Agent 主力引擎。本攻略聚焦其 API 接入成本 与 编码类 Agent 任务性价比,为有实际落地需求的开发者提供一份可复现的参考。 核心事实(均来自官方来源,详见「核验过程」): | 维度 | 数据 | ||| | API 模型名 | gp…
dairai/dairacademyplugins 是 DAIR.AI 维护的一个 Claude Code 插件市场,涵盖 AI 课程助教、X 情报流、论文策展、图像生成、LLM Council 等多个垂直场景。其中 xagentintelligence 插件(v1.4.0)解决了一个实际问题:如何把 X(Twitter)上关注的 AI / Agent 账号…