一个真实的账本

上个月我帮一个朋友算了一笔账。他在做一个 AI 客服产品,每天需要调用约 50 万次 API。他一直在用 GPT-4o,每个月的花费超过了 8 万元。我帮他切换到了 DeepSeek V4-Flash 之后,同样的质量水平下,月成本降到了 1.2 万元。

这不是个例。DeepSeek 最核心的竞争优势之一就是它的定价——但很多人其实没有把它算清楚。这篇文章我就把 DeepSeek 的 API 定价体系、各种优化策略、以及自建与调用的经济账全部拆开来讲。

DeepSeek API 定价全貌

基础价格表

DeepSeek 采用”百万 tokens”作为计价单位,分高峰时段和空闲时段两个价格档位。

模型 价格类型 高峰时段 空闲时段
V4-Flash
输入(缓存未命中) 元/百万 tokens 3.0 1.5
输入(缓存命中) 元/百万 tokens 0.10 0.05
输出 元/百万 tokens 9.0 4.5
V4-Pro
输入(缓存未命中) 元/百万 tokens 9.0 4.5
输入(缓存命中) 元/百万 tokens 0.30 0.15
输出 元/百万 tokens 27.0 13.5

时段定义:

  • 高峰时段:北京时间 9:00-12:00、14:00-18:00
  • 空闲时段:其余时间(12:00-14:00、18:00-次日 9:00)

与竞品价格对比

模型 输入价格 输出价格 上下文长度
DeepSeek V4-Flash 3.0 元 9.0 元 100万 token
DeepSeek V4-Pro 9.0 元 27.0 元 100万 token
GPT-4o ~4.5 元 ~18.0 元 128K token
Claude 3.5 Sonnet ~13.5 元 ~54.0 元 200K token
Gemini Pro ~3.6 元 ~10.8 元 200K token

注意单位差异:GPT-4o 和 Claude 的价格是美元,上面的人民币价格按 1 美元 ≈ 7 元换算。

关键发现

第一,V4-Flash 的输入价格(3 元/百万 tokens)甚至低于 GPT-4o(4.5 元),而且输出价格(9 元)也只有 GPT-4o 的一半。这意味着在同等输入量下,V4-Flash 的总成本约为 GPT-4o 的 40-60%。

第二,缓存命中机制把输入成本进一步降低到 0.10 元/百万 tokens——这是未命中价格的 3%。对于有大量重复系统提示词的应用,这个差距巨大。

第三,空闲时段的价格是高峰时段的一半。如果你的应用主要在非工作时间运行(比如批量处理、夜间任务),可以直接省一半。

实际成本案例:三种典型场景

场景一:智能客服

假设一个智能客服系统,每天处理 1 万次对话,每次对话平均消耗:

  • 输入:500 tokens(用户问题 + 系统提示词)
  • 输出:200 tokens(回复)

V4-Flash(高峰时段):

  • 输入成本:10000 × 500 × 3.0/1,000,000 = 15 元/天
  • 输出成本:10000 × 200 × 9.0/1,000,000 = 18 元/天
  • 日成本:33 元
  • 月成本:990 元

V4-Flash(缓存命中,系统提示词固定):

  • 假设系统提示词占总输入的 70%(350 tokens 缓存命中)
  • 缓存命中输入:10000 × 350 × 0.10/1,000,000 = 0.35 元
  • 缓存未命中输入:10000 × 150 × 3.0/1,000,000 = 4.5 元
  • 输出成本:18 元
  • 日成本:22.85 元
  • 月成本:685 元

GPT-4o(对比):

  • 输入成本:10000 × 500 × 4.5/1,000,000 = 22.5 元
  • 输出成本:10000 × 200 × 18.0/1,000,000 = 36 元
  • 日成本:58.5 元
  • 月成本:1755 元

结论:在相同场景下,DeepSeek V4-Flash 的成本约为 GPT-4o 的 40-50%。如果利用缓存命中,差距进一步扩大到 60% 以上。

场景二:内容创作助手

假设一个 AI 写作助手,每天生成 100 篇文章,每篇文章:

  • 输入:2000 tokens(提示词 + 参考材料)
  • 输出:5000 tokens(文章正文)

V4-Flash(高峰时段):

  • 输入成本:100 × 2000 × 3.0/1,000,000 = 0.6 元
  • 输出成本:100 × 5000 × 9.0/1,000,000 = 4.5 元
  • 日成本:5.1 元
  • 月成本:153 元

V4-Pro(高峰时段,追求更高写作质量):

  • 输入成本:100 × 2000 × 9.0/1,000,000 = 1.8 元
  • 输出成本:100 × 5000 × 27.0/1,000,000 = 13.5 元
  • 日成本:15.3 元
  • 月成本:459 元

GPT-4o(对比):

  • 输入成本:100 × 2000 × 4.5/1,000,000 = 0.9 元
  • 输出成本:100 × 5000 × 18.0/1,000,000 = 9.0 元
  • 日成本:9.9 元
  • 月成本:297 元

结论:内容创作场景中,输出 token 占比很大,成本主要由输出决定。V4-Flash 的输出成本(9 元)是 GPT-4o(18 元)的一半。

场景三:代码助手

假设一个代码助手产品,每天处理 5000 次代码生成请求,每次:

  • 输入:3000 tokens(代码上下文 + 问题描述)
  • 输出:1000 tokens(生成的代码)

V4-Flash(思考模式开启,用于复杂代码任务):

  • 输入:3000 tokens,输出:1000 + 3000(思考过程约 3000 tokens)= 4000 tokens
  • 输入成本:5000 × 3000 × 3.0/1,000,000 = 45 元
  • 输出成本:5000 × 4000 × 9.0/1,000,000 = 180 元
  • 日成本:225 元
  • 月成本:6750 元

V4-Flash(不启用思考模式):

  • 输入成本:45 元
  • 输出成本:5000 × 1000 × 9.0/1,000,000 = 45 元
  • 日成本:90 元
  • 月成本:2700 元

注意:思考模式的成本增加主要来自于输出部分——模型把推理过程也作为输出返回了。如果你的代码助手主要做简单代码补全,完全不需要开启思考模式。

自建 vs API:经济账该怎么算

自建成本构成

假设你在阿里云购买一台 GPU 服务器:

配置 价格(月) 能跑的模型
单卡 A10 24GB ~1500 元 R1-7B(量化)
单卡 A100 40GB ~3500 元 R1-32B(量化)
双卡 A100 40GB ~7000 元 V3(量化)
4 卡 A100 80GB ~15000 元 V3/R1(FP16)

成本平衡点计算

以单卡 A100 40GB 为例,月成本 3500 元,能跑 R1-32B 的量化版本:

  • API 调用 V4-Flash 的等效成本:3500 元 ÷ 3.0 元/百万 tokens ≈ 116 万 tokens/月
  • 按每次对话 1000 tokens 计算:约 116 万次对话/月
  • 按每天 30 天计算:约 3.8 万次对话/天

也就是说,如果你的应用每天需要超过 3.8 万次对话,自建 A100 服务器就比 API 调用更划算。但如果你只有 1000 次/天,自建完全不划算——3500 元的服务器成本对应不到 100 元的 API 成本。

自建的其他隐性成本

除了硬件成本,自建还需要考虑:

  • 运维人力:服务器维护、模型更新、故障处理
  • 电力成本:一台 A100 服务器的功耗约 500W,电费约 360 元/月
  • 网络成本:高带宽需求,尤其是模型文件下载和 API 响应
  • 模型更新:新模型发布后需要下载和部署,32B 模型的量化版本也有 20GB

综合计算,自建的”真实成本”大约是硬件成本的 1.3-1.5 倍。

推荐策略

  • 日调用量 < 5000 次:直接用 API,成本最低
  • 日调用量 5000-50000 次:可以考虑自建 1-2 卡方案,配合 API 做峰值弹性
  • 日调用量 > 50000 次:自建多卡集群,API 作为备份

成本优化的综合策略

策略一:混合模型路由

不是所有请求都需要用最强模型。一个聪明的做法是根据请求类型动态选择模型:

1
2
3
4
5
6
7
8
def route_request(user_input):
if is_simple_classification(user_input):
model = "deepseek-v4-flash" # 简单任务用便宜模型
elif is_complex_reasoning(user_input):
model = "deepseek-v4-pro" # 复杂任务用贵模型
else:
model = "deepseek-v4-flash" # 默认用便宜模型
return model

这种策略可以在不损失质量的前提下,将平均成本降低 30-50%。

策略二:缓存优化

系统提示词的一致性是最容易被忽视的优化点。确保:

  • 相同用户会话使用相同的系统提示词
  • 不要动态拼接系统提示词
  • 把动态内容放在 user prompt 里

策略三:批量处理

将多个请求合并为批量处理。DeepSeek 的 batch API 可以在不降低质量的前提下,提高吞吐量并降低总延迟。

策略四:输出控制

用 max_tokens 严格限制输出长度。很多开发者没有设置这个参数,导致模型输出远超预期的内容。一个简单的 max_tokens=500 可以帮你节省大量成本。

总结

DeepSeek 的定价策略在当前的 AI 市场里是非常有竞争力的。V4-Flash 以低于 GPT-4o 的价格提供了 8 倍的上下文长度,而 V4-Pro 在需要更强推理能力的场景下,价格也只有 GPT-4 级别模型的一半左右。

但便宜不等于”随便用”。我看到的最大的成本浪费来自于三个场景:

  1. 在不需要思考模式的场景里强行开启
  2. 没有利用缓存命中机制,系统提示词频繁变化
  3. 不设置输出长度上限,让模型”自由发挥”

把这三个问题解决,你就能在享受 DeepSeek 强大能力的同时,把成本控制在理论最小值的附近。

最后一篇文章我会讲如何把 DeepSeek 集成到实际的 RAG 和 Agent 项目中——这是 DeepSeek 能力最能发挥价值的地方,也是创业者最应该关注的方向。