Gemini 3.7 Flash 长上下文实测表现 · 干货攻略
- 链接: https://x.com/simonw/status/2082122012726608345
- 分类: x-tips
- 来源: X @simonw
- 作者: Jay
- 更新: 2026-08-21
这是什么
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工作负载模型,基于 Gemini 3.6 Flash 的算法改进版,主打编码和 Agent 场景。官方标称上下文窗口为 1,048,576 tokens(约 1M),最大输出 65,536 tokens(64K),支持文本、图像、音频、视频、PDF 多模态输入。
本攻略的核心议题是:该模型在超长上下文下的实际召回表现,与官方标称窗口之间的关系,以及你该如何正确使用它。
为什么值得关注
@simonw(Simon Willison)在 X 上分享了 Gemini 3.7 Flash 的关键发现,指向了一个容易忽略的陷阱:模型虽然技术上支持 100 万 token 的上下文窗口,但 Google 官方模型卡中的长上下文召回基准 GDM-MRCR v2 仅在 128k token 粒度下测试(8-needle 平均),取得了 97.0% 的检索准确率——而 128k 以上区间的召回表现,官方未提供任何数据。
这意味着如果你计划向模型投喂大量文档做 RAG 或分析,在 128k token 之后,实际可用性没有公开数据支撑,需要自行测试或保守处理。
核验过程
官方来源
1. Google DeepMind Gemini 3.7 Flash 模型卡 (https://deepmind.google/models/model-cards/gemini-3-7-flash/,2026 年 8 月 13 日发布)
关键数据摘录:
| 项目 | 数值 |
|---|---|
| 模型 ID | gemini-3.7-flash |
| 发布日期 | 2026 年 8 月 13 日 |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 最大输出 | 65,536 tokens(64K) |
| GDM-MRCR v2(8-needle,128k 平均) | 97.0% |
| FrontierCode 1.1 Main | 43.6%(3.6 Flash: 34.4%) |
| DeepSWE v1.1 | 65.3%(3.6 Flash: 48.6%) |
| AutomationBench | 30.4%(3.6 Flash: 17.0%) |
| 输入价格(引入期) | $0.75 / 1M tokens |
| 输出价格(引入期) | $3.75 / 1M tokens |
| 输入价格(2027 年 1 月 1 日起) | $1.50 / 1M tokens |
| 输出价格(2027 年 1 月 1 日起) | $7.50 / 1M tokens |
注意:GDM-MRCR v2 基准仅在 128k token 粒度下有数据,模型卡未提供 128k 以上区间的召回率数字。模型依赖文档指向 Gemini 3.6 Flash 模型卡 PDF。
2. Google Cloud Gemini Enterprise Agent Platform 定价页 (https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing)
关键结论:
- Gemini 3.7 Flash 全窗口统一计费,不区分短/长上下文,不存在 200K token 的价格悬崖(这与 3.1 Pro / 2.5 Pro 不同)
- 引入期价格 $0.75 / $3.75 per 1M tokens,有效期至 2026 年 12 月 31 日
- 2027 年 1 月 1 日起标准价格为 $1.50 / $7.50,翻倍
- 缓存输入(Cached Input)引入期 $0.075 / 1M tokens(约 9 折)
交叉验证
通过 Tavily 搜索多个第三方来源(kie.ai、apidog.com、emergent.sh、myclaw.ai 等)交叉核验,结论一致:
- 所有来源均确认 1M token 上下文窗口,64K 最大输出
- 所有来源均确认引入期 $0.75/$3.75,2027 年翻倍至 $1.50/$7.50
- 多个来源指出 GDM-MRCR 基准仅在 128k 粒度测试,128k 以上无公开数据
- 确认 3.7 Flash 全窗口统一费率,不存在 200K 定价翻倍机制
⚠️ 无法核验的说法
@simonw 原帖链接(simonwillison.net/2026/Aug/13/gemini-37-flash)目前返回 404,无法确认其帖中提及的具体数字(如 input $0.15→$0.30/M、output $6→$10/M 等)。这些数字在 Google 官方文档和所有第三方来源中均未找到对应记录,攻略正文不引用这些未经确认的数字。
上手步骤
1. 获取 API Key
访问 Google AI Studio 或通过 Google Cloud Vertex AI 获取密钥。Gemini 3.7 Flash 已普遍可用(GA)。
2. 调用示例(Python + google-generativeai)
import google.generativeai as genai
import os
genai.configure(api_key=os.environ["GEMINI_API_KEY"])
model = genai.GenerativeModel("gemini-3.7-flash")
# 短上下文调用
response = model.generate_content("解释这段代码的逻辑:...")
print(response.text)
3. 长上下文调用(推荐保守策略)
# 读取大文档(建议控制在 128k tokens 以内以获得可靠召回)
with open("large_doc.txt", "r") as f:
content = f.read()
# Gemini 对 token 的估算约 4 字符 ≈ 1 token
# 128k tokens ≈ 512k 字符;超此范围建议分块或自行测试召回
if len(content) > 500_000:
print("⚠️ 超过 128k token 建议分块处理,召回率无官方保证")
# 分块策略:按章节或按固定字符数拆分
chunks = [content[i:i+500_000] for i in range(0, len(content), 500_000)]
else:
response = model.generate_content(f"分析以下文档:\n{content}")
print(response.text)
4. 上下文缓存降成本
# 使用上下文缓存,引入期享受 90% 折扣
result = genai.embed_content(
model="gemini-3.7-flash",
content=content,
task_type="RETRIEVAL_DOCUMENT"
)
# 缓存后相同内容再次调用费用大幅降低
5. 监控长上下文调用成本
# 2027 年 1 月 1 日起费率翻倍,提前做好预算规划
# 当前引入期: $0.75 / $3.75 per 1M
# 未来标准: $1.50 / $7.50 per 1M
def estimate_cost(input_tokens, output_tokens, post_2027=False):
rate_in = 1.50 if post_2027 else 0.75
rate_out = 7.50 if post_2027 else 3.75
cost = (input_tokens / 1_000_000) * rate_in \
+ (output_tokens / 1_000_000) * rate_out
return cost
print(f"本次调用预估: ${estimate_cost(50_000, 5_000):.4f}")
print(f"2027 年后同一调用: ${estimate_cost(50_000, 5_000, post_2027=True):.4f}")
坑与适用边界
坑 1:1M 窗口 ≠ 1M 可用召回
Google 官方 GDM-MRCR v2 基准仅在 128k token 粒度验证了召回准确率(97.0%),128k 以上的长距离召回无官方数据。如果你的任务依赖模型准确找到跨越数十万 token 的信息点,强烈建议在部署前自行做召回测试,不要假设性能线性保持。
建议:对超长文档(>128k tokens)采用分块+汇总的两阶段方案,而非一次梭哈全部上下文。
坑 2:引入期价格有截止日期
$0.75/$3.75 的优惠价格有效期至 2026 年 12 月 31 日,之后立刻翻倍至 $1.50/$7.50。如果你在做年度预算或长期合同规划,务必将翻倍后的价格纳入计算。大量使用的团队可以考虑在 2026 年 Q4 提前锁量。
坑 3:64K 输出上限
模型的单次输出上限为 65,536 tokens(约 64K),对于需要生成超长报告的场景需要注意截断风险。长输出任务可以拆解为多轮调用。
坑 4:3.7 Flash ≠ 3.6 Flash 架构完全相同
Gemini 3.7 Flash 基于 3.6 Flash 的算法改进,并非新的预训练runs。模型卡将所有架构细节指向 3.6 Flash PDF——如果你需要深入理解底层能力(硬件、训练数据),请查阅 Gemini 3.6 Flash 模型卡 PDF。
适用边界
| 场景 | 推荐 |
|---|---|
| 编码助手 / Agent 工作流 | ✅ 强烈推荐(性价比极高) |
| 128k 以内 RAG | ✅ 可用,召回有数据支撑 |
| 500k+ 超长文档分析 | ⚠️ 无官方召回数据,谨慎使用 |
| 企业级工作流自动化 | ✅ AutomationBench 提升显著 |
| 多模态文档理解(PDF/视频) | ✅ 支持,建议实测 |
一句话结论
Gemini 3.7 Flash 是目前性价比最高的工作负载模型之一($0.75/$3.75 per 1M),编码和 Agent 任务提升显著,但 128k token 以上的长上下文召回没有官方基准数据支撑,超长文档场景不要裸用 1M 窗口,记得 2027 年初价格翻倍提前做好预算。