zAI上新
模型 ID:

z-ai/glm-5.3-flash

GLM-5 系列首个原生多模态模型。总参 320B、激活 18B,采用稀疏注意力与线性注意力混合架构;智能强于 GLM-5.2,注意力计算与 KV 缓存较 GLM-5.3 分别降低约 3.01× 与 4.44×。支持 1M 上下文,输入文本/图像/视频/文件,思考不可关闭。

立即接入
发布时间:2026.08.26
工具调用结构化输出视频理解图像理解深度思考内容缓存
上下文
1000K
最大输出
128K
输入类型
文本 / 图像 / 视频 / 文件
输出类型
文本
价格方案
不同上下文区间和计费项可能采用不同单价,请以请求实际命中的价格规则为准。
条件计费项价格
输入长度 (0, 无限] 且输出长度 (0, 无限]输出0.0028 元 / K
缓存输入0.00023 元 / K
非缓存输入0.0008 元 / K
API 接入
使用模型 ID 和对应的 Base URL,即可通过兼容接口接入模型。
Model ID
z-ai/glm-5.3-flash
用于在推理接口中指定模型
模型别名
模型 ID 的兼容别名,与 Model ID 等价
API Key
用于设置推理接口的 Bearer Token(OAuth 2.0 认证令牌)
Completions BaseURL
https://api.qnaigc.com/v1
兼容 Completions 接口(即 /chat/completions),支持 OpenAI SDK、Codex 等
Messages BaseURL
https://api.qnaigc.com/
兼容 Messages 接口(即 /v1/messages),支持配置到 Claude Code 等工具
API 文档
详细的接口说明、参数定义和使用示例
模型介绍
关于模型能力、适用场景与使用限制的官方说明。

GLM-5 系列首个原生多模态模型。总参 320B、激活 18B,采用稀疏注意力与线性注意力混合架构;智能强于 GLM-5.2,注意力计算与 KV 缓存较 GLM-5.3 分别降低约 3.01× 与 4.44×。支持 1M 上下文,输入文本/图像/视频/文件,思考不可关闭。