DE

DeepSeek V4.1 Flash

DeepSeek 发布 2026年9月10日 ImageText deepseek-v4-1-flash

模型简介

DeepSeek-V4.1-Flash 是一款快速高效的多模态 AI 模型,具备先进的推理、编码和智能体能力。支持高达 100 万 tokens 上下文和原生视觉理解,以更低的推理成本提供前沿级智能,非常适合 AI 智能体、自动化、编码助手和可扩展应用。

规格与价格

上下文窗口
1M Token
最大输出
384K Token
输入价格
¥2/M
输出价格
¥8/M
缓存读取
¥0.04/M
发布日期
2026年9月10日
输入价格
¥2/M
输出价格
¥8/M
缓存读取
¥0.04/M

API 能力

推理
支持
工具调用
支持
Temperature 参数
支持
附件
支持
知识库
2025-05-01
Endpoint 协议
Completions API

模型亮点

DeepSeek V4.1 Flash 结合原生视觉理解、100 万 Token 上下文、可调推理强度,以及针对大输入量 Agent 任务优化的模型架构。

DeepSeek V4.1 Flash 模型亮点
DeepSeek V4.1 Flash 结合原生视觉理解、100 万 Token 上下文、可调推理强度,以及针对大输入量 Agent 任务优化的模型架构。
原生视觉理解
模型联合处理图像与文本表示,使视觉信息能够直接参与推理并影响文本回答。
百万 Token 上下文
最高 100 万 Token 的上下文窗口可用于分析大型代码仓库、长篇文档和持续时间较长的 Agent 历史记录。
可调推理强度
推理强度可在 1 至 100 之间连续调整,便于开发者针对不同任务权衡思考深度与运行时间。
高效非对称架构
Causal Encoder-Decoder 在处理输入时激活 8B 参数、生成时激活 16B 参数,并通过压缩注意力降低持久化 KV Cache 需求。

适用场景

DeepSeek V4.1 Flash 适合仓库级软件开发、视觉文档分析、长上下文研究和多步骤自动化任务。

DeepSeek V4.1 Flash 使用场景
DeepSeek V4.1 Flash 适合仓库级软件开发、视觉文档分析、长上下文研究和多步骤自动化任务。
仓库级软件开发
检查大型代码库并追踪依赖关系,通过终端编程工作流完成跨文件修改并验证修复结果。
视觉文档分析
解读截图、图表和文档图像,回答相关问题、提取所需信息并生成文本摘要。
长上下文研究
在同一工作上下文中审阅大量技术资料,关联不同章节的依据并输出结构化结论。
多步骤 Agent 自动化
规划并执行工具辅助工作流,将信息收集、推理和代码执行结合起来,完成具体操作任务。

调用示例

from openai import OpenAI

client = OpenAI(
    base_url="https://api.tokiway.com/v1",
    api_key="YOUR_TOKIWAY_KEY",
)

resp = client.chat.completions.create(
    model="deepseek-v4-1-flash",
    messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)

更多说明

DeepSeek

DeepSeek V4 Flash Vision Exp

deepseek-v4-flash-vision-exp
TextImage
Text

最大上下文

1M

最大输出

384K

发布日期

暂无

输入¥3 / 百万 Token
输出¥9 / 百万 Token

DeepSeek 的其他模型

DE
DeepSeek R1
DeepSeek
DeepSeek R1 是 DeepSeek 的推理型模型,常被提到的特点是开放推理过程,以及在数学、逻辑和代码任务上的表现。它与 V3 一代共享大规模 MoE 的基础能力,但训练和产品定位更偏向深度推理,而不是普通对话。适合需要拆解、验证和逐步求解的复杂问题。
128K Token 上下文 32.8K Token 输出 2025年1月20日
输入¥4/M
输出¥16/M
缓存¥1.6/M
DE
DeepSeek V3
DeepSeek
DeepSeek V3 是 V3 系列的通用 MoE 基座模型,常见官方资料描述为 671B 总参数、37B 激活参数。技术报告强调 MLA、DeepSeekMoE、高效训练,以及较强的通用语言和代码能力。在模型列表中,它更适合作为 DeepSeek 的通用对话与代码基线模型,而不是单纯的深度推理专用模型。
128K Token 上下文 16K Token 输出 2024年12月26日
输入¥2/M
输出¥8/M
缓存¥0.8/M
DE
DeepSeek V3.1 Terminus
DeepSeek
DeepSeek V3.1 Terminus 是 DeepSeek 对 V3.1 系列的官方升级版本,重点在语言一致性和更稳定的 Agent 行为。官方发布说明中特别提到 Code Agent 和 Search Agent 能力改进,因此它更适合需要推理、工具调用和检索结合的工作流。它不是彻底改变 V3.1 的模型定位,而是让原有能力在实际 Agent 场景中更稳定、更可靠。
128K Token 上下文 64K Token 输出 2025年9月22日
输入¥4/M
输出¥12/M
缓存¥0.6/M
DE
DeepSeek V3.2 Think
DeepSeek
DeepSeek V3.2 通常被介绍为基于 V3.1 系列升级的高效推理与工具调用模型。这里的 Think 可以理解为偏推理的模式,更适合多步骤解题、结构化规划,以及需要中间思考过程的 Agent 任务。相关来源强调稀疏注意力和长上下文效率,因此它的定位不是短回复,而是复杂工作流和需要推理链条的任务。
128K Token 上下文 64K Token 输出 2025年12月1日
输入¥2/M
输出¥3/M
缓存¥0.2/M
DE
DeepSeek V4 Flash
DeepSeek
DeepSeek V4 Flash 保留了 V4 系列的 1M token 长上下文能力,但采用更轻量的 MoE 配置,常见模型卡描述为 284B 总参数、13B 激活参数。它的重点不是最大推理深度,而是更快推理、更低调用成本和更适合生产环境的吞吐量。对于高频请求、批量处理和长上下文但不一定需要最高推理强度的任务,Flash 会比 Pro 更合适。
1M Token 上下文 384K Token 输出 2026年4月24日
输入¥3/M
输出¥9/M
缓存¥0.1/M
DE
DeepSeek V4 Flash Vision Exp
DeepSeek
DeepSeek V4 Flash Vision Exp 是 DeepSeek V4 Flash 0731 的实验性视觉增强版本,在保持基础模型文本性能(包括智能体能力、推理和世界知识)的同时,引入图像理解功能。它基于稀疏混合专家(MoE)架构,总参数为284B,激活参数为13B。
1M Token 上下文 384K Token 输出 2026年8月21日
输入¥3/M
输出¥9/M
缓存¥0.1/M