Aliyun上新
模型 ID:

qwen/qwen3.8-flash-next

开源多模态 MoE,Qwen4 架构先导。125B 总参、每 token 激活 6B,另含 51B N-gram Embedding。原生 262,144 上下文,YaRN 可至 1,000,000;支持文本、图像、视频输入与深度思考。

立即接入
发布时间:2026.08.26
工具调用结构化输出视频理解图像理解深度思考内容缓存
上下文
1000K
最大输出
128K
输入类型
文本 / 图像 / 视频
输出类型
文本
价格方案
不同上下文区间和计费项可能采用不同单价,请以请求实际命中的价格规则为准。
条件计费项价格
输入长度 (0, 无限] 且输出长度 (0, 无限]输出0.003 元 / K
缓存输入0.0001 元 / K
显式缓存输入0.0001 元 / K
缓存创建0.00125 元 / K
非缓存输入0.001 元 / K
API 接入
使用模型 ID 和对应的 Base URL,即可通过兼容接口接入模型。
Model ID
qwen/qwen3.8-flash-next
用于在推理接口中指定模型
模型别名
模型 ID 的兼容别名,与 Model ID 等价
API Key
用于设置推理接口的 Bearer Token(OAuth 2.0 认证令牌)
Completions BaseURL
https://api.qnaigc.com/v1
兼容 Completions 接口(即 /chat/completions),支持 OpenAI SDK、Codex 等
Messages BaseURL
https://api.qnaigc.com/
兼容 Messages 接口(即 /v1/messages),支持配置到 Claude Code 等工具
API 文档
详细的接口说明、参数定义和使用示例
模型介绍
关于模型能力、适用场景与使用限制的官方说明。

Qwen3.8-Flash-Next

Qwen 开源的多模态 MoE,作为即将用于 Qwen4 的模型结构先导预览。带视觉编码器的因果语言模型:125B 总参、每 token 激活 6B,另含 51B N-gram Embedding 与 4B MTP。

能力

  • 原生上下文 262,144 tokens,YaRN 可扩展至 1,000,000
  • 输入支持文本、图像、视频;输出文本
  • 支持深度思考(thinking)与非思考(instruct)模式
  • 架构要点:Gated DeltaNet + Qwen Sparse Attention(QSA)、Gated Residual、N-gram Embedding