Gemini 3.7 Flash 长上下文实测表现 · 干货攻略

  • 链接: https://x.com/simonw/status/2082122012726608345
  • 分类: x-tips
  • 来源: X @simonw
  • 作者: Jay
  • 更新: 2026-08-21

这是什么

Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日发布的工作负载模型,基于 Gemini 3.6 Flash 的算法改进版,主打编码和 Agent 场景。官方标称上下文窗口为 1,048,576 tokens(约 1M),最大输出 65,536 tokens(64K),支持文本、图像、音频、视频、PDF 多模态输入。

本攻略的核心议题是:该模型在超长上下文下的实际召回表现,与官方标称窗口之间的关系,以及你该如何正确使用它。

为什么值得关注

@simonw(Simon Willison)在 X 上分享了 Gemini 3.7 Flash 的关键发现,指向了一个容易忽略的陷阱:模型虽然技术上支持 100 万 token 的上下文窗口,但 Google 官方模型卡中的长上下文召回基准 GDM-MRCR v2 仅在 128k token 粒度下测试(8-needle 平均),取得了 97.0% 的检索准确率——而 128k 以上区间的召回表现,官方未提供任何数据。

这意味着如果你计划向模型投喂大量文档做 RAG 或分析,在 128k token 之后,实际可用性没有公开数据支撑,需要自行测试或保守处理。

核验过程

官方来源

1. Google DeepMind Gemini 3.7 Flash 模型卡 (https://deepmind.google/models/model-cards/gemini-3-7-flash/,2026 年 8 月 13 日发布)

关键数据摘录:

项目 数值
模型 ID gemini-3.7-flash
发布日期 2026 年 8 月 13 日
上下文窗口 1,048,576 tokens(1M)
最大输出 65,536 tokens(64K)
GDM-MRCR v2(8-needle,128k 平均) 97.0%
FrontierCode 1.1 Main 43.6%(3.6 Flash: 34.4%)
DeepSWE v1.1 65.3%(3.6 Flash: 48.6%)
AutomationBench 30.4%(3.6 Flash: 17.0%)
输入价格(引入期) $0.75 / 1M tokens
输出价格(引入期) $3.75 / 1M tokens
输入价格(2027 年 1 月 1 日起) $1.50 / 1M tokens
输出价格(2027 年 1 月 1 日起) $7.50 / 1M tokens

注意:GDM-MRCR v2 基准仅在 128k token 粒度下有数据,模型卡未提供 128k 以上区间的召回率数字。模型依赖文档指向 Gemini 3.6 Flash 模型卡 PDF。

2. Google Cloud Gemini Enterprise Agent Platform 定价页 (https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing)

关键结论:

  • Gemini 3.7 Flash 全窗口统一计费,不区分短/长上下文,不存在 200K token 的价格悬崖(这与 3.1 Pro / 2.5 Pro 不同)
  • 引入期价格 $0.75 / $3.75 per 1M tokens,有效期至 2026 年 12 月 31 日
  • 2027 年 1 月 1 日起标准价格为 $1.50 / $7.50,翻倍
  • 缓存输入(Cached Input)引入期 $0.075 / 1M tokens(约 9 折)

交叉验证

通过 Tavily 搜索多个第三方来源(kie.ai、apidog.com、emergent.sh、myclaw.ai 等)交叉核验,结论一致:

  • 所有来源均确认 1M token 上下文窗口,64K 最大输出
  • 所有来源均确认引入期 $0.75/$3.75,2027 年翻倍至 $1.50/$7.50
  • 多个来源指出 GDM-MRCR 基准仅在 128k 粒度测试,128k 以上无公开数据
  • 确认 3.7 Flash 全窗口统一费率,不存在 200K 定价翻倍机制

⚠️ 无法核验的说法

@simonw 原帖链接(simonwillison.net/2026/Aug/13/gemini-37-flash)目前返回 404,无法确认其帖中提及的具体数字(如 input $0.15→$0.30/M、output $6→$10/M 等)。这些数字在 Google 官方文档和所有第三方来源中均未找到对应记录,攻略正文不引用这些未经确认的数字

上手步骤

1. 获取 API Key

访问 Google AI Studio 或通过 Google Cloud Vertex AI 获取密钥。Gemini 3.7 Flash 已普遍可用(GA)。

2. 调用示例(Python + google-generativeai)

import google.generativeai as genai
import os

genai.configure(api_key=os.environ["GEMINI_API_KEY"])

model = genai.GenerativeModel("gemini-3.7-flash")

# 短上下文调用
response = model.generate_content("解释这段代码的逻辑:...")
print(response.text)

3. 长上下文调用(推荐保守策略)

# 读取大文档(建议控制在 128k tokens 以内以获得可靠召回)
with open("large_doc.txt", "r") as f:
    content = f.read()

# Gemini 对 token 的估算约 4 字符 ≈ 1 token
# 128k tokens ≈ 512k 字符;超此范围建议分块或自行测试召回
if len(content) > 500_000:
    print("⚠️ 超过 128k token 建议分块处理,召回率无官方保证")
    # 分块策略:按章节或按固定字符数拆分
    chunks = [content[i:i+500_000] for i in range(0, len(content), 500_000)]
else:
    response = model.generate_content(f"分析以下文档:\n{content}")
    print(response.text)

4. 上下文缓存降成本

# 使用上下文缓存,引入期享受 90% 折扣
result = genai.embed_content(
    model="gemini-3.7-flash",
    content=content,
    task_type="RETRIEVAL_DOCUMENT"
)
# 缓存后相同内容再次调用费用大幅降低

5. 监控长上下文调用成本

# 2027 年 1 月 1 日起费率翻倍,提前做好预算规划
# 当前引入期: $0.75 / $3.75 per 1M
# 未来标准:    $1.50 / $7.50 per 1M

def estimate_cost(input_tokens, output_tokens, post_2027=False):
    rate_in = 1.50 if post_2027 else 0.75
    rate_out = 7.50 if post_2027 else 3.75
    cost = (input_tokens / 1_000_000) * rate_in \
         + (output_tokens / 1_000_000) * rate_out
    return cost

print(f"本次调用预估: ${estimate_cost(50_000, 5_000):.4f}")
print(f"2027 年后同一调用: ${estimate_cost(50_000, 5_000, post_2027=True):.4f}")

坑与适用边界

坑 1:1M 窗口 ≠ 1M 可用召回

Google 官方 GDM-MRCR v2 基准仅在 128k token 粒度验证了召回准确率(97.0%),128k 以上的长距离召回无官方数据。如果你的任务依赖模型准确找到跨越数十万 token 的信息点,强烈建议在部署前自行做召回测试,不要假设性能线性保持。

建议:对超长文档(>128k tokens)采用分块+汇总的两阶段方案,而非一次梭哈全部上下文。

坑 2:引入期价格有截止日期

$0.75/$3.75 的优惠价格有效期至 2026 年 12 月 31 日,之后立刻翻倍至 $1.50/$7.50。如果你在做年度预算或长期合同规划,务必将翻倍后的价格纳入计算。大量使用的团队可以考虑在 2026 年 Q4 提前锁量。

坑 3:64K 输出上限

模型的单次输出上限为 65,536 tokens(约 64K),对于需要生成超长报告的场景需要注意截断风险。长输出任务可以拆解为多轮调用。

坑 4:3.7 Flash ≠ 3.6 Flash 架构完全相同

Gemini 3.7 Flash 基于 3.6 Flash 的算法改进,并非新的预训练runs。模型卡将所有架构细节指向 3.6 Flash PDF——如果你需要深入理解底层能力(硬件、训练数据),请查阅 Gemini 3.6 Flash 模型卡 PDF

适用边界

场景 推荐
编码助手 / Agent 工作流 ✅ 强烈推荐(性价比极高)
128k 以内 RAG ✅ 可用,召回有数据支撑
500k+ 超长文档分析 ⚠️ 无官方召回数据,谨慎使用
企业级工作流自动化 ✅ AutomationBench 提升显著
多模态文档理解(PDF/视频) ✅ 支持,建议实测

一句话结论

Gemini 3.7 Flash 是目前性价比最高的工作负载模型之一($0.75/$3.75 per 1M),编码和 Agent 任务提升显著,但 128k token 以上的长上下文召回没有官方基准数据支撑,超长文档场景不要裸用 1M 窗口,记得 2027 年初价格翻倍提前做好预算。