QW
Qwen3.7 Max
模型简介
Qwen3.7 Max 被定位为 Qwen3.7 一代的旗舰模型,官方叙事重点是面向 Agent 时代。相关模型卡强调 Agent 工作流、代码、办公/生产力任务,以及长周期自主执行能力。它不应该只被写成“更大的聊天模型”,而应该描述为面向复杂工作的高能力通用模型。
规格与价格
- 上下文窗口
- 1M Token
- 最大输出
- 65.5K Token
- 输入价格
- ¥12/M
- 输出价格
- ¥36/M
- 缓存读取
- ¥2.4/M
- 发布日期
- 2026年5月21日
- 输入价格
- ¥12/M
- 输出价格
- ¥36/M
- 缓存读取
- ¥2.4/M
- 缓存创建 5m
- ¥15/M
- 缓存读取 5m
- ¥1.2/M
API 能力
- 推理
- 支持
- 工具调用
- 支持
- Temperature 参数
- 支持
- 附件
- 不支持
- 知识库
- —
- Endpoint 协议
- Messages API
模型亮点
Qwen3.7 Max 结合面向 Agent 的推理、编程与生产力能力以及百万 Token 上下文,适合复杂文本任务。
Qwen3.7 Max 模型亮点
Qwen3.7 Max 结合面向 Agent 的推理、编程与生产力能力以及百万 Token 上下文,适合复杂文本任务。
Agent 级推理
模型能够规划并持续推进多步骤工作,适合需要连续决策和长程执行的任务。
编程与生产力
模型擅长编程、办公和生产力任务,可完成结构化分析与协调一致的文本生成。
百万 Token 上下文
百万 Token 上下文窗口可容纳大型代码库、长篇文档和持续时间较长的文本交互。
适用场景
Qwen3.7 Max 适合仓库级软件开发、长程文本 Agent 以及大规模商业或技术文档分析。
Qwen3.7 Max 使用场景
Qwen3.7 Max 适合仓库级软件开发、长程文本 Agent 以及大规模商业或技术文档分析。
仓库级开发
分析大型代码库中的依赖关系,实施跨文件改动,并检查修改对相关组件的影响。
长程 Agent
在多步骤研究、编程或运营工作流中持续保留目标和中间结果,并推进后续任务。
大规模文档分析
审阅大规模文本集合,关联不同章节的依据,并生成结构化摘要、对比结果或行动方案。
调用示例
from openai import OpenAI
client = OpenAI(
base_url="https://api.tokiway.com/v1",
api_key="YOUR_TOKIWAY_KEY",
)
resp = client.chat.completions.create(
model="qwen3-7-max",
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)
Qwen 的其他模型
QW
Qwen3.5 35B-A3B
Qwen
Qwen3.5 35B A3B 是一个原生视觉语言 MoE 模型,目标是在较小激活参数下接近更大模型的效果。模型卡强调混合线性注意力、稀疏专家,以及与更大 Qwen3.5 dense 版本相近的表现。它最适合被描述为兼顾效率、多模态推理和代码能力的轻量高效模型。
262.1K Token 上下文
65.5K Token 输出
2026年2月23日
输入¥0.4/M
输出¥3.2/M
QW
Qwen3.5 Flash
Qwen
Qwen3.5 Flash 是 Qwen3.5 原生视觉语言系列中的高效版本。阿里云模型列表将 Flash 定位为面向简单任务的快速、低成本选项,同时继承了 3.5 一代的多模态方向。它适合信息抽取、请求路由、轻量内容生成和高频调用。
262.1K Token 上下文
65.5K Token 输出
2026年2月23日
输入¥0.2/M
输出¥2/M
QW
Qwen3.5 Plus
Qwen
Qwen3.5 Plus 是 Qwen3.5 系列中的均衡版本,通常被介绍为原生视觉语言模型,并在托管服务中提供较强效率和较大上下文能力。官方和三方资料将它与图像/视频理解、通用文本任务和内置工具能力联系在一起。它处在 Flash 的速度取向和 Max 的能力取向之间。
1M Token 上下文
65.5K Token 输出
2026年2月16日
输入¥0.8/M
输出¥4.8/M
QW
Qwen3.6 35B-A3B
Qwen
Qwen3.6 35B A3B 是一个激活参数较小的 MoE 模型:相关来源描述为 35B 总参数、约 3B 激活参数,并具备可扩展到接近 1M token 的长上下文能力。官方资料还提到它在代码任务上可以与更大的 dense 模型竞争。它的核心价值是部署效率高,同时保留不错的代码和长上下文能力。
262.1K Token 上下文
65.5K Token 输出
2026年4月17日
输入¥1.8/M
输出¥10.8/M
QW
Qwen3.6 Flash
Qwen
Qwen3.6 Flash 是 Qwen3.6 系列中更强调速度的版本。相关来源提到它支持文本、图片和视频输入、Prompt Caching,以及 1M token 上下文窗口,这让它在快速模型里有较强的长上下文和多模态特征。它更适合高并发、多模态和长上下文任务中对速度与成本敏感的场景。
1M Token 上下文
65.5K Token 输出
2026年4月27日
输入¥1.2/M
输出¥7.2/M
QW
Qwen3.6 Max Preview
Qwen
Qwen3.6 Max 通常被视为 Qwen3.6 一代中更高能力的档位。可参考的三方资料强调大规模稀疏 MoE 架构、更强的 Agentic Coding,以及面向工具调用的行为。它的描述应聚焦软件工程、推理和自主工作流执行,而不是只写“更好的文本生成”。
262.1K Token 上下文
65.5K Token 输出
2026年4月20日
输入¥9/M
输出¥54/M