五分类增量补遗 · Jay · 2026-08-22 深夜版

本次主题:五分类增量 · 本轮 Tavily 搜索新发现条目 角色:Jay · 增量补充,不重复已有内容


分类总览

分类 新增条目 核心来源
database 1 Tavily · pgvector vs Qdrant 2026 对比
backend 2 Tavily · SWE-bench ProMax / SWE Atlas / EdgeBench
cloud-native 0 本轮无新增
csdn 1 Tavily · CSDN AI 编程工具横向评测
reproduction 1 Tavily · 开源模型格局 Kimi K3 / DeepSeek V4 / GLM-5.2

📦 一、database

DB-N1:pgvector vs Qdrant 2026 生产决策框架

来源pgvector vs Qdrant (2026): Postgres Vector Search vs a Dedicated Vector DB · OpenTechStack
可信度:⭐⭐⭐⭐(工程决策框架,非厂商赞助)

核心工程数据
- pgvector 适用场景:已在用 Postgres、10M 向量以下、生产级运维成熟度要求高、需要 ACID 事务+SQL 过滤组合 - Qdrant 适用场景:大规模向量+过滤混合查询、多租户、集群分片、运维可接受独立系统 - pgvector 0.9 + Postgres 17/18:HNSW 索引大幅改进,10M 向量以下生产级可用,运营成本最低 - 2026 成本参考:1M 查询/月,10M 向量规模下 pgvector RDS r6g.2xl ~$250(与现有 RDS 共享),Qdrant Cloud ~$120,Qdrant 自托管 ~$40,Pinecone Serverless ~$180 - 延迟参考:pgvector(HNSW 调优)p95 ~35ms / Qdrant Cloud ~22ms / Pinecone ~45ms - 迁移路径:pgvector → Qdrant later——设计好 ID/embedding dual-write pipeline,scale 触发时平滑迁移

评价:2026 年向量数据库选型已从"谁性能最强"转向"谁的 ops 负担与我的团队规模匹配"。pgvector 已不再是玩具extension,而是 10M 向量以下的生产首选。本文是最实用的决策树,没有之一。

链接https://open-techstack.com/blog/pgvector-vs-qdrant-2026


⚙️ 二、backend

BE-N1:SWE-Bench ProMax — 大规模多文件 SWE 基准(arXiv COLM 2026)

来源SWE-Bench ProMax · arXiv:2608.09802 · COLM 2026
作者:Yisen Xu, Jinqiu Yang et al.
可信度:⭐⭐⭐⭐⭐(COLM 2026 会议论文,完整技术报告)

核心数据
- SWE-Bench ProMax vs SWE-bench Verified 对比:30% 实例修改 >10 文件(Verified 仅 7%);32% 修改 >200 行代码(Verified 仅 6%) - 真实生产复杂度:SWE-Bench Verified 86% 实例只改 1 个文件,ProMax 推进到多文件协同修改场景 - 基线模型(Claude Code scaffold):Claude Opus 4.8 / GPT-5.5 / Gemini-3.1-Pro / Qwen3.7-Max / DeepSeek-V4-Pro / Kimi-K2.7-Code / MiniMax-M2 等覆盖主流闭源+开源

评价:SWE-bench ProMax 是对"Agent 能否处理真实大型代码库重构"的最严格评估。对 SWE-bench Verified 的刷分已无意义——ProMax 才是 2026 下半年编码 Agent 的新战场。

链接https://arxiv.org/pdf/2608.09802


BE-N2:SWE Atlas + EdgeBench + Terminal-Bench — 编码 Agent 评测体系全景

来源Awesome-Long-Horizon-Agents · RUC-NLPIR
可信度:⭐⭐⭐⭐(汇总型资源列表,有原始论文链接)

重要新基准收录
- SWE Atlas(arXiv 2026):Agent 在 issue 解决之外的全维度能力评测 - RepoZero(arXiv 2026):LLM 能否从零生成完整代码仓库 - SWE-World(arXiv 2026):Docker-Free 环境下的 SWE Agent - Terminal-Bench(arXiv 2026):命令行界面硬核任务评测,Kimi K3 得分 88.3 vs GPT-5.6 Sol 88.8 - EdgeBench(arXiv 2026):超长周期任务(134 任务,平均运行时 3-4 小时),覆盖 SWE / 科学 / ML 工程 / 形式化证明 / 游戏

评价:编码 Agent 评测体系正在从"单点任务"进化到"超长周期+多文件+多工具链"复合评估。EdgeBench 的出现标志着 Agent 评估已进入"真实项目周期"阶段。

链接https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents


🌐 三、cloud-native

(本轮无新增条目,详见已有 2026-08-22T1450-jay-engineering-filter-pm.md


💻 四、csdn

CS-N1:2026 最新 AI 编程工具横向评测(CSDN)

来源2026年最新AI编程工具观察:5款主流AI编程软件能力解析 · CSDN
可信度:⭐⭐⭐(CSDN 精选,非营销软文)

核心工程数据
| 工具 | 定位 | 核心优势 | 局限 | |------|------|---------|------| | Kimi Code(月之暗面)| 全流程 Agent IDE | Plan 模式/Sub-agents/Agent Swarm/四级扩展机制(MCP/Skills/Hooks/Plugins)| 生态封闭 | | Claude Code(Anthropic)| CLI 编程助手 | Sub-agents + Skill 生态 + Agent Teams + Dynamic Workflows | 未对中国大陆提供服务,风控趋严 | | Codex(OpenAI)| CLI 编程工具 | 响应速度快,多任务并行,Apache-2.0 | 复杂重构任务质量略逊 Claude Code | | CodeBuddy(腾讯云)| 全流程 AI 研发 | 多模型切换,覆盖需求→部署全流程,腾讯云生态集成 | 生态局限于腾讯云 |

Benchmark 数据(ProgramBench):Kimi K3 77.8% vs GPT-5.6 Sol 77.6%,差距极小
SWE-bench Pro:Claude Opus 4.8 约 69.2% vs GPT-5.5 约 58.6%
DeepSWE:GPT-5.6 Sol 73.0% vs Kimi K3 67.5%
SWE Marathon 长周期:Kimi K3 42.0% vs Opus-4.8 40.0% vs GPT-5.6 Sol 39.0%

评价:本篇是中文社区少有的高质量 AI 编程工具横向评测,数据来源标注清楚(各厂商公开发布+第三方基准)。Kimi Code 的 Agent Swarm 和多级扩展机制值得关注,是国产编程 Agent 的工程能力代表。

链接https://www.csdn.net/article/2026-07-30/163342366


🔬 五、reproduction

RE-N1:开源模型格局 2026 年中盘点(modelgrep + MorphLLM)

来源Best Open-Source LLMs — Top Open-Weight AI Models (August 2026) · modelgrep + MorphLLM 对比
可信度:⭐⭐⭐⭐(第三方综合排名,多源数据交叉)

Intelligence Index 排名(2026-08)

排名 模型 Intelligence 速度(tok/s) 输入成本 许可证
🥇 Kimi K3 59.7 93 $3.00/M Kimi License(非商业)
🥈 Qwen3.8 2.4T A95B 57.7 106 $2.00/M Apache 2.0
🥉 DeepSeek V4 Pro 0813 53.2 115 $1.19/M MIT
4 DeepSeek V4 Pro 0423 53.2 62 $0.481/M MIT
5 GLM-5.2 52.6 129 $0.966/M MIT
6 Qwen3.8 27B 52.0 91 $0.450/M Apache 2.0
7 DeepSeek V4 Flash 0731 51.8 148 $0.080/M MIT
8 DeepSeek V4 Flash 0423 51.8 85 $0.074/M MIT
9 MiniMax M3 45.4 163 $0.300/M Community
10 Kimi K2.6

关键洞察
- Kimi K3 Intelligence Index 第一(59.7),前端代码 Arena 第一,Human's Last Exam 约 56%,SWE-bench Verified 93.4%,但权重非商业许可 - DeepSeek V4 Flash 性价比最高:$0.08/M 输入,MIT 许可证,148 tok/s,适合大规模部署 - GLM-5.2 Intelligence Index 第五但 Apache 2.0 许可证最具商业兼容性 - MiniMax M3 推理速度最快(163 tok/s),适合延迟敏感场景

评价:开源模型格局已形成中国厂商主导局面(Kimi/DeepSeek/Qwen/MiniMax/GLM)。许可证差异是生产选型的关键变量——Kimi K3 性能第一但非商业许可,DeepSeek V4 Flash 性价比最优。

链接https://modelgrep.com/best/open-source


📋 写入路径

本次增量补充草稿/shared/research-kb/inbox/jay/2026-08-22T2300-jay-five-category-supplement.md

建议精读 / 审稿: 1. SWE-Bench ProMax 论文(arXiv:2608.09802)→ 纳入 SWE-bench 主题页更新 2. pgvector vs Qdrant 2026 决策框架 → 纳入 Vector DB 选型手册 3. Kimi Code 评测全文(CSDN)→ 国产编程 Agent 工程能力参考

无需审稿:modelgrep 排名(数据直接引用),Awesome-Long-Horizon-Agents(资源列表)