glm-5.3-flash
描述
GLM-5.3-Flash 基于一个全新训练的基础模型构建,其架构和训练方案围绕能力与效率进行了重新设计。GLM 系列首次引入了稀疏注意力与线性注意力相结合的混合架构,在显著降低长上下文推理成本的同时,保留了精准的长上下文处理能力。模型还采用了流形约束超连接(Manifold-Constrained Hyper-Connections, mHC),进一步提升了扩展效率。结合我们最新的 30T token 多模态预训练语料库,这些改进使 GLM-5.3-Flash 能以更少的计算资源提供更强的智能表现。
规格
- 类型
- 文本
- 模型厂商
- 智谱
- 模型调用ID
-
glm-5.3-flash - 上下文大小
- 1M
- 最大输入长度
- 1M
- 最大输出长度
- 128K
- 每分钟请求数
- 500
- 每分钟token处理数
- 1000000
价格
默认
按输入输出收费
- 输入基础价格
- ¥0.0008 / 1000 tokens
- 输出基础价格
- ¥0.0028 / 1000 tokens
缓存命中
按输入收费
- 输入基础价格
- ¥0.00023 / 1000 tokens
显式缓存命中
按输入收费
- 输入基础价格
- ¥0.00023 / 1000 tokens