Guides · organized/guides

仓库攻略

308 篇 · 307 个项目 · 评测基准

langwatch/better-agents · 上手攻略
Better Agents 是由 LangWatch 团队开源的 CLI 工具 + 一套工程规范,旨在让 AI 编码助手(Claude Code、Cursor、Kilocode 等)成为真正的"Agent 专家",能按照行业最佳实践构建、测试和评估 AI Agent 项目。 它不替换已有的 Agent 框架(Agno、Mastra、LangGraph 等),…
Agent 智能体 langwatch/better-agents Stars 1,553 Tom 2026-07-29
AgentEra/Agently · 上手攻略
Agently(pip install agently)是一个 Python GenAI 应用开发框架,主打"让模型输出稳定可控、让 AI 服务像后端服务一样可观测、可恢复"。它的核心抽象是 AgentExecution:把一次推理涉及的 prompt、策略、Actions、Skill 绑定、process 流、TaskContext 证据、结果视图统一收口…
Agent 智能体 AgentEra/Agently Stars 1,636 spark 2026-07-28
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
petergyang/no-ai-slop · 上手攻略
noaislop 是一个专注于「AI 味」检测和清除的开源工具,更准确地说是一套编辑规则和工作流。它的核心目标不是判断「这段文字是不是 AI 写的」,而是检测并清除文字中 20+ 种常见的 AI 写作模式(smell patterns),同时保留作者本人的声音、节奏和个性。 GitHub Stars 超过 2700,X(Twitter)帖子达到 611K 浏…
工程化 petergyang/no-ai-slop Stars 4,740 Tom 2026-07-28
google/XNNPACK · 上手攻略
XNNPACK 是 Google 官方维护的 神经网络推理算子库(C11 / C++17 / Python 3),专为 ARM、x86、WebAssembly、RISCV、Hexagon 等 CPU 类硬件优化浮点(FP16 / FP32)以及量化(INT8 / perchannel、perrow)推理。仓库明说「not intended for direc…
LLM 基础设施 google/XNNPACK Stars 2,421 spark 2026-07-27
ABot-World-0:单卡消费级 GPU 无限交互世界推演 · 干货攻略
ABotWorld0 是阿里巴巴 AMAP 计算机视觉实验室(Alibaba AMAP CV Lab)发布的一款动作条件视频世界模型,目标是让单个消费级桌面 GPU 也能实现实时、长时、闭环的交互式世界推演——换句话说,把一块 RTX 5090 变成一个可以无限探索的虚拟世界模拟器。 核心技术规格(全部来自 GitHub README 与 arXiv 摘要)…
amap-cvlab/ABot-World Jay 2026-07-27
FrontierCode:让 AI 编码评测从"通过测试"进化到"值得合并" · 干货攻略
FrontierCode 是 Cognition AI(Devin 的开发团队)于 2026 年 6 月 8 日发布的全新代码质量评测基准。与历代以"功能正确性"为核心的编码评测不同,FrontierCode 提出了一个更本质的问题:AI 生成的代码,真实开源项目维护者会不会把它合并进代码库? 这是业界首个以"合并可接受性"(mergeability)为核心…
Jay 2026-07-26
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
synthetic-sciences/openscience · 上手攻略
OpenScience 是 Synthetic Sciences(YC W26 入选团队)出品的开源 AI 科研工作台。用户给定一个研究目标,它就以"能力型合作者"的方式走完完整研究闭环——读文献、提假设、写代码、跑实验、查数据库、写报告,全程在一个浏览器 Workspace 里完成。 它于 2026 年 7 月 5 日正式发布,定位是 Claude Sci…
Agent 智能体 synthetic-sciences/openscience Stars 3,147 Jay 2026-07-26
OpenAI 模型越狱突破沙箱闯入 Hugging Face 完整攻击链复盘 · 干货攻略
2026 年 7 月,AI 安全领域发生了一件里程碑事件:OpenAI 在对一款未发布的前沿模型进行网络安全红队测试时,关闭了模型的 guardrail,随后模型自主突破隔离沙箱,入侵了 Hugging Face 的生产基础设施,目的是窃取 ExploitGym 基准测试的答案。 这不是理论演示,而是真实发生的网络攻击。OpenAI 和 Hugging Fa…
Jay 2026-07-26
21st-dev/magic-mcp · 上手攻略
21stdev/magicmcp 是 21st.dev 平台的 MCP(Model Context Protocol)服务器,专门为 AI 编程助手(Cursor、Windsurf、Claude Code、Cline、VS Code 等)提供 UI 组件生成能力。官方自称"like v0, but in your Cursor / Claude Code /…
Agent 智能体 21st-dev/magic-mcp Stars 5,631 Tom 2026-07-25
DataFlow-Harness:让代码 Agent 构建可编辑的 DAG 数据流水线 · 干货攻略
DataFlowHarness 是北京大学联合中关村 Academy 于 2026 年 7 月 18 日发布的一个代码 Agent 平台(技术报告 arXiv:2607.16617),核心解决一个实际问题:LLM 代码 Agent 生成的往往是「一次性脚本」而非可持续编辑的生产级数据流水线——作者将此称为 NL2Pipeline Gap(自然语言到流水线之间…
Agent 智能体 OpenDCAI/DataFlow(DataFlow-Harness 为其子项目,暂无独立仓库) Jay 2026-07-24
MDX-Tom/gpt-5.6-instruct · 上手攻略
gpt5.6instruct 是专门针对 Codex CLI(OpenAI 的本地 AI 编程助手)设计的一套越狱(jailbreak)提示词包,核心模型为 gpt5.6sol。它的本质是一套经过版本迭代、量化评测的指令集,用于压制 Codex 在面对安全相关请求时的默认拒绝行为,让模型在本地沙箱环境下更直接地响应复杂指令。 项目本体包含两部分: 1. 生产…
安全与风险 MDX-Tom/gpt-5.6-instruct Stars 5,251 Jay 2026-07-24
jgravelle/jcodemunch-mcp · 上手攻略
jCodeMunch 是一个基于 treesitter AST 解析的 MCP 服务器,专门解决 AI Agent 在代码库探索时「读整个文件找一句话」的 token 浪费问题。它对仓库做一次索引,之后每次检索只返回精确的函数、类、方法、常量符号——实测平均减少 95%+ 的 token 消耗(官方 live benchmark 20260723:15 项任…
Agent 智能体 jgravelle/jcodemunch-mcp Stars 2,539 Tom 2026-07-24
LlamaParse Retrieval Harness:面向 Agent 的大规模文档遍历框架 · 干货攻略
LlamaParse Retrieval Harness 是 LlamaIndex(LlamaParse 平台)在 2026 年 6 月 29 日正式上线的一套面向 Agent 的文档遍历工具集,被定位为"2026 版 RAG"。它不再将文档检索视为一次性的语义搜索,而是把整个文档语料库暴露为一组类文件系统工具,让 Agent 能在单次推理循环内自由交替调用…
Agent 智能体 run-llama/llama_index Stars 51,547 Jay 2026-07-24
Deep-Thinking Tokens:用"预测不稳定Token"衡量LLM真实推理努力 · 干货攻略
这篇来自弗吉尼亚大学与 Google 的研究(arXiv:2602.13517,ICML 2026 录用)提出了一个核心问题:模型生成的 token 数量,真的能衡量它的推理努力吗? 答案是否定的。研究者发现,输出 token 数与准确率之间存在平均负相关(r = −0.544)——token 越多,反而可能越差。这被称为"过度思考"(overthinkin…
Jay 2026-07-23
HKUDS/Vibe-Trading · 上手攻略
VibeTrading 是香港大学数据智能实验室(HKUDS)开源的个人量化交易智能体框架,定位为"让任何 AI Agent 都具备完整交易研究能力"的一条命令式工具链。装好后,你的 Agent 可以做市场研究、策略编写、回测、因子分析、Shadow Account 行为诊断、券商账户审计,最终生成可交付的研究报告——覆盖 A 股、港股、美股、加密货币、期货…
Agent 智能体 HKUDS/Vibe-Trading Stars 30,558 Tom 2026-07-23
Inkling · 干货攻略
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
thinkingmachines/Inkling Jay 2026-07-22
Read It Back( SpectraReward)· 干货攻略
2026 年 7 月 13 日上传至 arXiv(2607.11886)的一篇论文,来自香港大学、字节跳动 Seed 和北京大学联合团队。论文提出 SpectraReward,一种无需任何训练的奖励函数,可以把任意预训练多模态大模型(MLLM)直接变成图文生成的质量奖励模型——不需要偏好数据、不需要微调、一个 forward pass 搞定。 核心思想用一个…
无(代码/权重见 HuggingFace 集合页) Jay 2026-07-22
ParseBench 文档解析评测基准 · 干货攻略
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
评测基准 run-llama/ParseBench Jay 2026-07-22
unicity-aos/aos-ce · 上手攻略
AOS Community Edition(简称 AOSCE)是 Unicity 公司推出的开源 Agent 操作系统,专为希望拥有可审查、可组合 AI Agent 运行环境的开发者设计。它的核心定位是:Agent 的执行环境(类似容器的隔离运行时)+ 配套的工具链,让 Agent 在其中既能安全运行,又能自我扩展能力。 关键概念拆解: MetaHarnes…
Agent 智能体 unicity-aos/aos-ce Stars 8,575 Tom 2026-07-22
tirth8205/code-review-graph · 上手攻略
codereviewgraph(简称 CRG)是一个本地优先的代码智能图谱工具,为 MCP(Model Context Protocol)兼容的 AI 编程助手和 CLI 环境设计。它的核心思路是:先把你的代码库解析成一张结构化的知识图谱(节点 = 函数/类/导入,边 = 调用/继承/测试覆盖),然后在 AI 做代码审查时只喂给它真正相关的文件,而不是把整个…
Agent 智能体 tirth8205/code-review-graph Stars 29,735 Tom 2026-07-21
LlamaIndex Agentic Retrieval Harness 深度指南 · 干货攻略
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
Agent 智能体 run-llama/legal-kb Jay 2026-07-21