Jev 是 TypeSafe AI(2026 年 9 月中旬发布)的首个 "System One" 模型——它不是语言模型,不生成任何文本,只做一件事:输入一段结构化 state,加上类型化的问题,得到带概率的决策答案。 这个定位恰好精确命中了 Agent 评测的核心形状:给定 agent 的 trace 和状态,判断这次行为是否合规、是否安全、评分几分。 …
仓库攻略
74 篇 · 74 个项目 · jay · 安全与风险
AI Engineering Course 是由 Amit Shekhar(Outcome School 创始人)维护的免费、完整、自包含的 AI 工程学习路径。目前 18 个模块、146+ 节课,每节课都是一篇图文并茂的博客,部分附视频。从机器学习基础讲到 LLM 微调、RAG、AI Agent、推理工程、AI Safety 和系统设计,适合想从零建立完整…
这是一个社区维护的下游 fork,专注于为 DeepSeek Harness(DeepSeek 官方桌面端)提供一等公民级的 Linux 打包支持。 官方 DeepSeek Harness 桌面端目前只发布 macOS 和 Windows 安装包,Linux 用户要么退而求其次用 Web 版,要么自己从源码编译。本项目填补了这个缺口:以 AppImage /…
这是一条关于 LLM 开发策略的硬核判断,来自 Sebastian Raschka(Sebastian Raschka,AI 教育者、《Build a Large Language Model (From Scratch)》作者)。 在被播客问到「如果有 xx 百万美元预算,怎么从头开发一个 frontier 级别 LLM」时,他的答案是: 用现有开源模型,…
SeepReverseLab(简称 Seep)是一个面向 AI Agent 的多平台客户端逆向工程自动化工作台,同时也是一套 CWE602(客户端授权脆弱性)专项审计框架。它将 Radare2、JADX、Apktool、Frida、IDA Pro 等分散的逆向工具链,封装为统一的 MCP(Model Context Protocol)工具矩阵,让 AI Ag…
WebCodex 是一个本地开发环境桥接工具,让云端 AI Agent(如 ChatGPT、Claude)直接使用你本机已有的真实代码仓库、Git 工作区和开发工具链,而不需要把代码上传到任何托管服务或云端沙箱。 核心定位是把「AI 客户端(MCP)」和「你的真实机器」连接起来:AI 负责理解、修改、审查代码,运行测试和命令;代码、编译器、Git 历史都在你…
一篇 2026 年 8 月 10 日提交的学术论文(arXiv:2608.09867,cs.CR),由来自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Snyk 的研究人员撰写。论文发现:Anthropic、OpenAI、Google …
2026 年 8 月 10 日,一支来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 的研究团队(含 Alexander Panfilov、David Schmotz、Ilia Shumailov 等人)在 arXiv 发布论文 "St…
2026 年 9 月,LangChain 正式集成 TypeSafe AI 的 Jev——一个非传统 LLM 的"System One"判决模型。Jev 不生成文本,而是接收一段状态(state)和若干结构化问题,返回置信概率和分类决策。LangChain 通过 langchaintypesafe 包将 Jev 接入 agent harness,为两个高频决…
OfficeIMO 是一个完全脱离 COM 和 Microsoft Office 的 .NET 文档处理库全家桶,用 Open XML SDK 底层实现,覆盖 Word(.docx / .doc)、Excel(.xlsx / .xls)、PowerPoint(.pptx / .ppt)、PDF、OneNote、Visio、Markdown、HTML、RTF、…
SoLPi(Scaling of Language — Pi)是 NVIDIA NVlabs 开源的一个 Pi Agent 引擎扩展包,通过四个可插拔的 Token 节省机制,在保持原有任务完成质量的前提下,大幅削减长时运行编码 Agent 的 token 流量和 API 成本。 它不是一个独立的 Agent,而是以插件形式叠加在 Pi(@earendilw…
Jev Reviewer(访问入口还有 Review)数据提取工具。研究者打开一篇论文的 PDF、补充材料、试验方案或数据表格,直接提问——例如"入组年龄范围是多少""谁资助了这项研究""随机化人数几人"——工具从文档中返回逐字引用(verbatim quote),标注来自哪个文件的哪一页、哪一段或哪一行,并在原文件中高亮显示该位置。无需安装、无需 API …
2026 年 9 月 11 日,Simon Willison 和 Alex Garcia 联合发布 Datasette 两个安全补丁版本——1.0a39(当前 alpha 系列)和 0.65.4(stable 系列),修复了一批权限相关漏洞。这批漏洞由 Sevban Dönmez 提交 AI 辅助报告后,触发了一次完整的 coding agent 安全审计,…
commitrewriter 是 Simon Willison(@simonw)9 月 14 日发布的本地 Web 应用,用于批量编辑 Git 仓库的提交信息。核心使用场景是:Coding Agent 生成的提交记录往往带有大量"机器腔"——冗长的内部 ID 引用、不适合公开的 issue 编号、重复的 agent 生成 boilerplate。Simon …
一个由 GPT6 Astra(Medium)+ OpenAI Codex 模式驱动的 AI 编码智能体,在 macOS 上自动调用本地已安装的 Blender 桌面应用,通过 Blender Python API 生成可编辑的 .blend 三维场景文件,并渲染出成品图像。 整个过程完全由自然语言驱动——用户只给了三句提示词,AI 自己: 1. 写 Pyth…
Pentest Swarm AI 是一个基于真实群智(Swarm)架构的开源渗透测试引擎,由 Go 语言编写,支持 Claude、GLM、Qwen、DeepSeek、Gemini、Ollama 等任意具备 functioncalling 能力的 LLM。与传统多 Agent 工具「单 Planner 按固定顺序调用各阶段」不同,Pentest Swarm A…
Miles 是 RadixArk 开源的企业级大模型 RL 后训练框架(v0.1 发布于 2026 年 8 月 18 日),定位与 OpenAI 的训练+推理协同思路类似,但完全开源。Miles 从 THUDM/slime 分叉而来,与 slime 保持共同演进。 核心架构:SGLang 负责高吞吐 rollout 生成 + NVIDIA MegatronL…
Blip 是一个在 Linux 桌面上收发 iMessage 的工具,通过让同一局域网(或 Tailscale 网络)内的 Mac 充当"网关"来实现——Mac 保持登录你的 Apple ID、运行 AppleScript 脚本处理消息,Linux 端只是一个轻薄的客户端界面(Omarchy 面板插件 + 独立 App)。 ⚠️ 前提条件:必须有一台 Mac…
MarkLLM 是清华大学 BPM 实验室开源的 LLM 水印工具包,发表在 EMNLP 2024 Demo,现已收录为 pip install markllm 包。它统一实现了当前主流的 LLM 文本水印算法(KGW、EXP、Unforgeable、SynthIDText 等 20+ 种),并提供标准化的评估流程(抗攻击测试、可视化工具),让研究者和工程师…
Reverify 是一个AI 辅助逆向工程工具包,核心解决 AI 在二进制逆向场景下"一本正经地胡说八道"的问题。它将语言模型置于确定性 RE 工具链的裁判之下:模型提出假设,工具链在真实二进制上验证,只有在 disassemble、patternmatch 或 emulator 执行后确认的结论才对外报告。 MIT 许可证,当前版本 v0.3.0,纯 Py…
SAM(Sovereign Agent Mesh)是由 Google 开发的一个零配置、零信任的 P2P 网络,专为自主 AI Agent 设计。它让 AI Agent 节点自动发现彼此、互相认证,并通过标准 MCP(Model Context Protocol)协议跨节点调用工具——不依赖将内部脚本或 API 暴露到公网。 当前状态:公开测试网(banan…
Tons of Skills 是一个面向 Claude Code 的开源插件技能市场,由 Jeremy Longshore(Intent Solutions)维护。它将散落在各处社区的 Claude Code 技能(Skill)打包成可发现、可安装、可评级的插件集合,通过 npm 包 + Web 界面双通道分发。截至 20260819 数据:471 个插件、…
gadak 是一个把 Jira 和 Confluence 同步到本地 SQLite 文件的开发者工具。它的核心价值主张很简单:把远程 API 调用变成本地 SQL 查询,让"哪个 Epic 实际卡住了?"这种需要 GROUP BY 的问题,从"无法回答"变成一条 SQL。 支持 macOS 桌面 App、Web UI、CLI 和 MCP 服务器(供 AI 编…
mu(读作 /mjuː/)是一个面向人类、AI 代理和服务的通用协议网络。它用一套协议栈(SMTP 收件、IMAP 读件、HTTP 服务、MCP 对接 Agent、XMPP 聊天、x402 支付)把邮件、工具、日历、文件、搜索等 100+ 项能力统一起来,让一个 AI Agent 可以像真人一样拥有自己的邮箱、联系人、日历和文件系统。 它的核心哲学是「地址即…
coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
Krasis 是一个混合 LLM 推理运行时,专注于在消费级显存受限的 NVIDIA GPU 上高效运行数百亿参数级别的 MoE(Mixture of Experts)大模型。它的核心设计目标是:让一张或两张普通游戏显卡(如 RTX 5090 32 GB、RTX PRO 6000 96 GB)就能跑得动原本需要 H100/A100 才能加载的千亿参数模型。 …
awesomedeepseekharness 是一个精选资源列表(Awesome List),收录 DeepSeek Harness(DSH)生态中最优质的插件、Skills、MCP 服务器、Patch/Profile 层、编排器和客户端。DeepSeek Harness 是 DeepSeek 官方发布的 Agent 运行时框架,核心理念是 Model + …
2026 年 8 月 10 日,一支由 8 位安全研究者组成的团队(包括来自 ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、MATS Research 等机构的学者)在 arXiv 上发表了一篇震惊业界的论文:"Stealing Reasoning Traces f…
Governance Decay(治理衰减)是一种新型智能体安全失效模式,由论文 Governance Decay: How Context Compaction Silently Erases Safety Constraints in LongHorizon LLM Agents(arXiv:2606.22528,2026 年 6 月)正式命名并系统量化…
ToolHive 是 Stacklok 开源的企业级 MCP(Model Context Protocol)服务器运行与管理平台,定位类似 MCP 界的"Kubernetes"——用容器隔离每一个 MCP 服务器,用声明式 API 集中管控注册表、网关、运行时和安全策略。 核心卖点三条: 1. 安全隔离:每个 MCP 服务器跑在独立容器里,凭证不泄露到本地,…