一个真实的账本
上个月我帮一个朋友算了一笔账。他在做一个 AI 客服产品,每天需要调用约 50 万次 API。他一直在用 GPT-4o,每个月的花费超过了 8 万元。我帮他切换到了 DeepSeek V4-Flash 之后,同样的质量水平下,月成本降到了 1.2 万元。
这不是个例。DeepSeek 最核心的竞争优势之一就是它的定价——但很多人其实没有把它算清楚。这篇文章我就把 DeepSeek 的 API 定价体系、各种优化策略、以及自建与调用的经济账全部拆开来讲。
DeepSeek API 定价全貌
基础价格表
DeepSeek 采用”百万 tokens”作为计价单位,分高峰时段和空闲时段两个价格档位。
| 模型 | 价格类型 | 高峰时段 | 空闲时段 |
|---|---|---|---|
| V4-Flash | |||
| 输入(缓存未命中) | 元/百万 tokens | 3.0 | 1.5 |
| 输入(缓存命中) | 元/百万 tokens | 0.10 | 0.05 |
| 输出 | 元/百万 tokens | 9.0 | 4.5 |
| V4-Pro | |||
| 输入(缓存未命中) | 元/百万 tokens | 9.0 | 4.5 |
| 输入(缓存命中) | 元/百万 tokens | 0.30 | 0.15 |
| 输出 | 元/百万 tokens | 27.0 | 13.5 |
时段定义:
- 高峰时段:北京时间 9:00-12:00、14:00-18:00
- 空闲时段:其余时间(12:00-14:00、18:00-次日 9:00)
与竞品价格对比
| 模型 | 输入价格 | 输出价格 | 上下文长度 |
|---|---|---|---|
| DeepSeek V4-Flash | 3.0 元 | 9.0 元 | 100万 token |
| DeepSeek V4-Pro | 9.0 元 | 27.0 元 | 100万 token |
| GPT-4o | ~4.5 元 | ~18.0 元 | 128K token |
| Claude 3.5 Sonnet | ~13.5 元 | ~54.0 元 | 200K token |
| Gemini Pro | ~3.6 元 | ~10.8 元 | 200K token |
注意单位差异:GPT-4o 和 Claude 的价格是美元,上面的人民币价格按 1 美元 ≈ 7 元换算。
关键发现
第一,V4-Flash 的输入价格(3 元/百万 tokens)甚至低于 GPT-4o(4.5 元),而且输出价格(9 元)也只有 GPT-4o 的一半。这意味着在同等输入量下,V4-Flash 的总成本约为 GPT-4o 的 40-60%。
第二,缓存命中机制把输入成本进一步降低到 0.10 元/百万 tokens——这是未命中价格的 3%。对于有大量重复系统提示词的应用,这个差距巨大。
第三,空闲时段的价格是高峰时段的一半。如果你的应用主要在非工作时间运行(比如批量处理、夜间任务),可以直接省一半。
实际成本案例:三种典型场景
场景一:智能客服
假设一个智能客服系统,每天处理 1 万次对话,每次对话平均消耗:
- 输入:500 tokens(用户问题 + 系统提示词)
- 输出:200 tokens(回复)
V4-Flash(高峰时段):
- 输入成本:10000 × 500 × 3.0/1,000,000 = 15 元/天
- 输出成本:10000 × 200 × 9.0/1,000,000 = 18 元/天
- 日成本:33 元
- 月成本:990 元
V4-Flash(缓存命中,系统提示词固定):
- 假设系统提示词占总输入的 70%(350 tokens 缓存命中)
- 缓存命中输入:10000 × 350 × 0.10/1,000,000 = 0.35 元
- 缓存未命中输入:10000 × 150 × 3.0/1,000,000 = 4.5 元
- 输出成本:18 元
- 日成本:22.85 元
- 月成本:685 元
GPT-4o(对比):
- 输入成本:10000 × 500 × 4.5/1,000,000 = 22.5 元
- 输出成本:10000 × 200 × 18.0/1,000,000 = 36 元
- 日成本:58.5 元
- 月成本:1755 元
结论:在相同场景下,DeepSeek V4-Flash 的成本约为 GPT-4o 的 40-50%。如果利用缓存命中,差距进一步扩大到 60% 以上。
场景二:内容创作助手
假设一个 AI 写作助手,每天生成 100 篇文章,每篇文章:
- 输入:2000 tokens(提示词 + 参考材料)
- 输出:5000 tokens(文章正文)
V4-Flash(高峰时段):
- 输入成本:100 × 2000 × 3.0/1,000,000 = 0.6 元
- 输出成本:100 × 5000 × 9.0/1,000,000 = 4.5 元
- 日成本:5.1 元
- 月成本:153 元
V4-Pro(高峰时段,追求更高写作质量):
- 输入成本:100 × 2000 × 9.0/1,000,000 = 1.8 元
- 输出成本:100 × 5000 × 27.0/1,000,000 = 13.5 元
- 日成本:15.3 元
- 月成本:459 元
GPT-4o(对比):
- 输入成本:100 × 2000 × 4.5/1,000,000 = 0.9 元
- 输出成本:100 × 5000 × 18.0/1,000,000 = 9.0 元
- 日成本:9.9 元
- 月成本:297 元
结论:内容创作场景中,输出 token 占比很大,成本主要由输出决定。V4-Flash 的输出成本(9 元)是 GPT-4o(18 元)的一半。
场景三:代码助手
假设一个代码助手产品,每天处理 5000 次代码生成请求,每次:
- 输入:3000 tokens(代码上下文 + 问题描述)
- 输出:1000 tokens(生成的代码)
V4-Flash(思考模式开启,用于复杂代码任务):
- 输入:3000 tokens,输出:1000 + 3000(思考过程约 3000 tokens)= 4000 tokens
- 输入成本:5000 × 3000 × 3.0/1,000,000 = 45 元
- 输出成本:5000 × 4000 × 9.0/1,000,000 = 180 元
- 日成本:225 元
- 月成本:6750 元
V4-Flash(不启用思考模式):
- 输入成本:45 元
- 输出成本:5000 × 1000 × 9.0/1,000,000 = 45 元
- 日成本:90 元
- 月成本:2700 元
注意:思考模式的成本增加主要来自于输出部分——模型把推理过程也作为输出返回了。如果你的代码助手主要做简单代码补全,完全不需要开启思考模式。
自建 vs API:经济账该怎么算
自建成本构成
假设你在阿里云购买一台 GPU 服务器:
| 配置 | 价格(月) | 能跑的模型 |
|---|---|---|
| 单卡 A10 24GB | ~1500 元 | R1-7B(量化) |
| 单卡 A100 40GB | ~3500 元 | R1-32B(量化) |
| 双卡 A100 40GB | ~7000 元 | V3(量化) |
| 4 卡 A100 80GB | ~15000 元 | V3/R1(FP16) |
成本平衡点计算
以单卡 A100 40GB 为例,月成本 3500 元,能跑 R1-32B 的量化版本:
- API 调用 V4-Flash 的等效成本:3500 元 ÷ 3.0 元/百万 tokens ≈ 116 万 tokens/月
- 按每次对话 1000 tokens 计算:约 116 万次对话/月
- 按每天 30 天计算:约 3.8 万次对话/天
也就是说,如果你的应用每天需要超过 3.8 万次对话,自建 A100 服务器就比 API 调用更划算。但如果你只有 1000 次/天,自建完全不划算——3500 元的服务器成本对应不到 100 元的 API 成本。
自建的其他隐性成本
除了硬件成本,自建还需要考虑:
- 运维人力:服务器维护、模型更新、故障处理
- 电力成本:一台 A100 服务器的功耗约 500W,电费约 360 元/月
- 网络成本:高带宽需求,尤其是模型文件下载和 API 响应
- 模型更新:新模型发布后需要下载和部署,32B 模型的量化版本也有 20GB
综合计算,自建的”真实成本”大约是硬件成本的 1.3-1.5 倍。
推荐策略
- 日调用量 < 5000 次:直接用 API,成本最低
- 日调用量 5000-50000 次:可以考虑自建 1-2 卡方案,配合 API 做峰值弹性
- 日调用量 > 50000 次:自建多卡集群,API 作为备份
成本优化的综合策略
策略一:混合模型路由
不是所有请求都需要用最强模型。一个聪明的做法是根据请求类型动态选择模型:
1 | def route_request(user_input): |
这种策略可以在不损失质量的前提下,将平均成本降低 30-50%。
策略二:缓存优化
系统提示词的一致性是最容易被忽视的优化点。确保:
- 相同用户会话使用相同的系统提示词
- 不要动态拼接系统提示词
- 把动态内容放在 user prompt 里
策略三:批量处理
将多个请求合并为批量处理。DeepSeek 的 batch API 可以在不降低质量的前提下,提高吞吐量并降低总延迟。
策略四:输出控制
用 max_tokens 严格限制输出长度。很多开发者没有设置这个参数,导致模型输出远超预期的内容。一个简单的 max_tokens=500 可以帮你节省大量成本。
总结
DeepSeek 的定价策略在当前的 AI 市场里是非常有竞争力的。V4-Flash 以低于 GPT-4o 的价格提供了 8 倍的上下文长度,而 V4-Pro 在需要更强推理能力的场景下,价格也只有 GPT-4 级别模型的一半左右。
但便宜不等于”随便用”。我看到的最大的成本浪费来自于三个场景:
- 在不需要思考模式的场景里强行开启
- 没有利用缓存命中机制,系统提示词频繁变化
- 不设置输出长度上限,让模型”自由发挥”
把这三个问题解决,你就能在享受 DeepSeek 强大能力的同时,把成本控制在理论最小值的附近。
最后一篇文章我会讲如何把 DeepSeek 集成到实际的 RAG 和 Agent 项目中——这是 DeepSeek 能力最能发挥价值的地方,也是创业者最应该关注的方向。