GLM-5.1:Z.AI的100万token上下文模型
Z.AI的旗舰模型。上下文窗口最高100万token。适合整仓代码或整个知识库级别的智能体,价格远低于Sonnet。
1M tokens · Text / Code · Prompt cache
Okou已不再运行GLM-5.1。本页作为它的规格、价格和基准测试参考保留。要做同类工作,请用GPT 5.6 Luna。
查看GPT 5.6 LunaGLM-5.1是这套阵容里的长上下文专家,输入最高可达100万token。当提示词真的很庞大时就用它:一次塞进整个代码仓库,或者一轮研究读完几百份文档。在长上下文任务上,独立榜单一直把它排在开源权重模型的第一梯队。
厂商标价为每百万token输入1.40美元、输出4.40美元,在厂商层面还不到Sonnet 4.6的一半;API兼容Anthropic,Claude风格的智能体不用重写就能换上。如果英文推理深度比上下文长度更重要,就用Sonnet或Opus;如果延迟是关键,就用Kimi K2.7 Code。
GLM-5.1是什么?
Z.AI / Zhipu AI的旗舰通用模型。
GLM-5.1是Zhipu AI旗下GLM系列的旗舰,通过Z.AI分发。这是一个通用能力很强的推理模型,上下文窗口大得不寻常:最高100万token,是同价位档Anthropic和Moonshot默认模型的好几倍。
GLM-5.1有什么特别之处
架构与能力上的主要亮点。
GLM-5.1通过兼容Anthropic的API提供最高100万token的上下文窗口(Built-in阵容里最大的一个),Claude风格的智能体不用改动就能接入。上游在api.z.ai上支持提示词缓存。
规格速览
GLM-5.1基准测试
独立评测把GLM-5.1列入长上下文任务的开源权重第一梯队。第三方榜单的数字每周都在变,我们在这里刻意不写死具体百分比。
GLM-5.1价格
服务商标价,按每100万token计。
GLM-5.1实际用起来怎么样
来自生产环境智能体运行的实际观察。
长上下文召回
GLM-5.1的100万token窗口是真能用的。越过200K这道限制住老一代Anthropic 200K模型的门槛之后,它依然能保持连贯。适合整仓代码或整个文档库级别的智能体。
推理能力
通用推理扎实。在最难的英文多工具调用上不如Sonnet 4.6,但相对于价格差,这点差距很小。
GLM-5.1最适合的智能体任务
一个提示词装下整个仓库的重构
把一个50万token的中型代码库一次性丢进GLM-5.1,让它做跨文件重命名、架构审查或安全排查。窗口更小的模型逼你把仓库切块再拼结果,bug往往就是这时候混进来的。GLM-5.1把每个文件都留在工作记忆里,输出时引用的路径也是对的。
一次读完几百份文档的研究任务
Wiki、RFC、合同、去年的客服工单——一次全部装进去,让它找跨文档的规律。厂商价格低,单次运行的成本就压得住,这才让「全部读完、一次总结」这类工作流在生产环境里真的用得起,而不是只能做一次的实验。
什么时候不该用GLM-5.1
最难的英文推理上Sonnet 4.6或Opus 4.7仍然领先,对延迟敏感的对话回复上Kimi K2.7 Code快得多,这两类场景别用GLM-5.1。
GLM-5.1与其他模型对比
GLM-5.1对比Kimi K2.7 Code
两者都是长上下文选项,积分成本接近(×0.4对×0.3)。在我们的内部评测里,Kimi的长上下文召回更强;GLM-5.1赢在窗口本身更大(100万对256K)。特别长的对话记录选Kimi;要把整个代码库塞进一个提示词就选GLM-5.1。
GLM-5.1对比Claude Sonnet 4.6
Sonnet 4.6(×1)在工具调用准确率和英文推理上领先。GLM-5.1(×0.4)赢在上下文窗口,当成本或上下文长度是决定因素时选它。
GLM-5.1对比DeepSeek V4 Pro
按第三方评测,DeepSeek V4 Pro(×0.1)更便宜,Code Arena跑分也更高。GLM-5.1仍然赢在上下文长度。对成本敏感、上下文正常的活选DeepSeek;上下文长度是瓶颈时选GLM-5.1。
结论:你该用GLM-5.1吗?
上下文长度是瓶颈时选GLM-5.1。其他情况下,DeepSeek V4 Pro更便宜,Sonnet 4.6的工具调用更可靠。
GLM-5.1在Okou上的可用情况
GLM-5.1已从Okou阵容中移除,因此在聊天和工作流里都无法再选用,也不能用你自己的API密钥接入。GPT 5.6 Luna覆盖同一个省钱档位。

