QW
Qwen3.5 Flash
模型简介
Qwen3.5 Flash 是 Qwen3.5 原生视觉语言系列中的高效版本。阿里云模型列表将 Flash 定位为面向简单任务的快速、低成本选项,同时继承了 3.5 一代的多模态方向。它适合信息抽取、请求路由、轻量内容生成和高频调用。
规格与价格
- 上下文窗口
- 262.1K Token
- 最大输出
- 65.5K Token
- 输入价格
- ¥0.2/M
- 输出价格
- ¥2/M
- 发布日期
- 2026年2月23日
- Token 阶梯
- <=128K
- 输入价格
- ¥0.2/M
- 输出价格
- ¥2/M
- 缓存创建 5m
- ¥0.25/M
- 缓存读取 5m
- ¥0.02/M
API 能力
- 推理
- 支持
- 工具调用
- 支持
- Temperature 参数
- 支持
- 附件
- 支持
- 知识库
- —
- Endpoint 协议
- Completions API
模型亮点
Qwen3.5 Flash 结合快速推理、原生多模态理解与长上下文处理,适合响应速度要求较高的生产任务。
Qwen3.5 Flash 模型亮点
Qwen3.5 Flash 结合快速推理、原生多模态理解与长上下文处理,适合响应速度要求较高的生产任务。
高效推理
混合线性注意力与稀疏 MoE 架构旨在提供快速响应,同时兼顾通用文本和多模态任务表现。
原生多模态
模型可接收文本、图像和视频输入并生成文本,从而在一个模型中完成混合媒体理解。
百万 Token 上下文
百万 Token 上下文窗口支持分析大篇幅文档、长对话以及规模较大的混合输入集合。
适用场景
Qwen3.5 Flash 适合响应式多模态助手、快速内容处理和长上下文信息审阅。
Qwen3.5 Flash 使用场景
Qwen3.5 Flash 适合响应式多模态助手、快速内容处理和长上下文信息审阅。
多模态客服
结合客户提供的截图、产品图像或短视频回答问题,并生成简洁的文字指引。
内容快速分拣
对大量文本和视觉内容进行分类、摘要或关键信息提取,供后续流程审阅。
长上下文审阅
审阅大型文档集合或长对话记录,定位相关细节并生成重点摘要。
调用示例
from openai import OpenAI
client = OpenAI(
base_url="https://api.tokiway.com/v1",
api_key="YOUR_TOKIWAY_KEY",
)
resp = client.chat.completions.create(
model="qwen3-5-flash",
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)
Qwen 的其他模型
QW
Qwen3.5 35B-A3B
Qwen
Qwen3.5 35B A3B 是一个原生视觉语言 MoE 模型,目标是在较小激活参数下接近更大模型的效果。模型卡强调混合线性注意力、稀疏专家,以及与更大 Qwen3.5 dense 版本相近的表现。它最适合被描述为兼顾效率、多模态推理和代码能力的轻量高效模型。
262.1K Token 上下文
65.5K Token 输出
2026年2月23日
输入¥0.4/M
输出¥3.2/M
QW
Qwen3.5 Plus
Qwen
Qwen3.5 Plus 是 Qwen3.5 系列中的均衡版本,通常被介绍为原生视觉语言模型,并在托管服务中提供较强效率和较大上下文能力。官方和三方资料将它与图像/视频理解、通用文本任务和内置工具能力联系在一起。它处在 Flash 的速度取向和 Max 的能力取向之间。
1M Token 上下文
65.5K Token 输出
2026年2月16日
输入¥0.8/M
输出¥4.8/M
QW
Qwen3.6 35B-A3B
Qwen
Qwen3.6 35B A3B 是一个激活参数较小的 MoE 模型:相关来源描述为 35B 总参数、约 3B 激活参数,并具备可扩展到接近 1M token 的长上下文能力。官方资料还提到它在代码任务上可以与更大的 dense 模型竞争。它的核心价值是部署效率高,同时保留不错的代码和长上下文能力。
262.1K Token 上下文
65.5K Token 输出
2026年4月17日
输入¥1.8/M
输出¥10.8/M
QW
Qwen3.6 Flash
Qwen
Qwen3.6 Flash 是 Qwen3.6 系列中更强调速度的版本。相关来源提到它支持文本、图片和视频输入、Prompt Caching,以及 1M token 上下文窗口,这让它在快速模型里有较强的长上下文和多模态特征。它更适合高并发、多模态和长上下文任务中对速度与成本敏感的场景。
1M Token 上下文
65.5K Token 输出
2026年4月27日
输入¥1.2/M
输出¥7.2/M
QW
Qwen3.6 Max Preview
Qwen
Qwen3.6 Max 通常被视为 Qwen3.6 一代中更高能力的档位。可参考的三方资料强调大规模稀疏 MoE 架构、更强的 Agentic Coding,以及面向工具调用的行为。它的描述应聚焦软件工程、推理和自主工作流执行,而不是只写“更好的文本生成”。
262.1K Token 上下文
65.5K Token 输出
2026年4月20日
输入¥9/M
输出¥54/M
QW
Qwen3.6 Plus
Qwen
Qwen3.6 Plus 的介绍重点在混合线性注意力与稀疏 MoE 架构,并强调 Agentic Coding、前端开发和推理任务的提升。公开模型卡提到仓库级任务、交互式前端生成,以及 SWE 类评测表现。它的定位更接近开发者与生产力模型,而不只是普通对话助手。
1M Token 上下文
65.5K Token 输出
2026年4月2日
输入¥2/M
输出¥12/M