DeepSeek 开放 V4.1 Flash 中间版本内测,单账号限流 20 并发

DeepSeek 于 9 月 8 日开放 V4.1 Flash 中间版本内测。内测用户无需更换 API 基础地址,只需使用临时模型名 deepseek-v4.1-flash-expires-on-0910;价格沿用 V4 Flash,单账号限流 20 并发。
DeepSeek V4.1 Flash 中间版本内测与 20 并发限制

内测使用临时模型名

这次内测没有替换现有的 deepseek-v4-flash。收到内测通知的 API 用户需要保持 https://api.deepseek.com 不变,把请求中的模型名改为:

1
deepseek-v4.1-flash-expires-on-0910

使用 OpenAI Python SDK 时,只需要替换 model 参数:

1
2
3
4
5
6
7
8
9
10
11
12
13
from openai import OpenAI

client = OpenAI(
api_key="<your DeepSeek API Key>",
base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
model="deepseek-v4.1-flash-expires-on-0910",
messages=[{"role": "user", "content": "请解释这段代码的作用。"}],
)

print(response.choices[0].message.content)

临时模型名包含 expires-on-0910。接入时应把它放在独立配置项中,不要直接替换生产环境的长期默认模型;内测入口变化后,只需改配置,不必重新修改业务代码。

价格沿用 V4 Flash

V4.1 Flash 中间版本按 V4 Flash 现行价格计费。每 100 万 Token 的人民币单价如下:

计费项目 空闲时段 高峰时段
缓存命中输入 0.05 元 0.10 元
缓存未命中输入 1.5 元 3.0 元
输出 4.5 元 9.0 元

Token 是模型处理文字时使用的计量单位。账单需要分别统计缓存命中输入、未命中输入和输出,不能只按请求次数估算。

20 并发限制决定了测试范围

中间版本对每个账号限制 20 个并发请求;常规 V4 Flash 的官方并发上限为 2500。这个差距使中间版本更适合验证提示词、接口兼容性和小规模任务,不适合直接承接现有生产流量或高并发压测。

已有项目不会自动切换到本次内测。常规模型名 deepseek-v4-flash 仍对应 DeepSeek-V4-Flash-0731 正式版 API;只有主动改用临时模型名的请求才会进入 V4.1 Flash 中间版本。

测试时保留回退路径

接入时可以把常规模型名和临时模型名分别写入配置,并保留一键回退。先用固定测试集检查返回格式、工具调用和业务输出,再逐步增加并发;需要长期运行的服务继续把 deepseek-v4-flash 作为稳定入口。

原始来源

以下资料用于核对本文信息;价格、开放范围与产品状态请以来源的最新说明为准。

  1. DeepSeek V4.1 Flash 中间版本内测通知截图与调用信息 — 核对内测日期、临时模型名、计费方式与并发限制
  2. DeepSeek API 首次调用文档 — 核对 API 基础地址与常规模型目录
  3. DeepSeek API 模型与价格 — 核对 V4 Flash 峰谷价格与常规并发上限
  4. DeepSeek API 更新日志 — 核对 V4 Flash 0731 正式版 API 状态