全部模型

Kimi K2.7 Code:Moonshot的代码模型

Moonshot最新的开源权重模型。在开源前沿拿下同级最佳的智能体跑分,接口兼容Claude。

256K tokens · Text / Vision / Code · Prompt cache

Okou已不再运行Kimi K2.7 Code。本页作为它的规格、价格和基准测试参考保留。要做同类工作,请用GPT 5.6 Luna。

查看GPT 5.6 Luna

Kimi K2.7 Code是Moonshot的开源权重旗舰,在多个公开基准上是目前最强的开源智能体模型。它能撑住很长的运行而不跑偏(Moonshot记录过12小时以上、4000多次工具调用的无人值守会话),并且原生接受图像和视频输入。厂商自报的SWE-bench Pro为58.6(在这项基准上高于Claude Opus 4.6和GPT-5.4),幻觉率也从K2.6的约65%降到约39%。

厂商标价为每百万token输入1.14美元、输出4.80美元,开源权重以Modified MIT协议发布,API兼容Anthropic。如果生产环境里工具调用的可靠性比跑分更重要,就用Sonnet 4.6;如果延迟是关键,就用Kimi K2.7 Code。

Kimi K2.7 Code是什么?

2026年6月 · Moonshot开源权重Kimi K2系列的顶配,K2.6和K2 Thinking的后继型号。

Kimi K2.7 Code是Moonshot AI在2026年6月发布的开源权重智能体模型。它是一个万亿参数的混合专家(MoE)模型,每个token激活320亿参数。架构与K2.6和K2 Thinking同源,在智能体编码和长周期推理上有明显提升。

K2.7在独立榜单上着实激起了不小的水花。厂商自报的成绩显示,它在SWE-bench Pro上领先GPT-5.4(xhigh)和Claude Opus 4.6(max effort),幻觉率为39%(K2.6是65%)。Artificial Analysis的Intelligence Index把它排在第4位,是开源权重里领先的选项。

Kimi K2.7 Code有什么特别之处

架构与能力上的主要亮点。

K2.7是混合专家模型,总参数1T、每token激活32B,配一个256K token的上下文窗口,支持图像和视频的多模态输入(输出仅文本)。Moonshot还为它配了Agent Swarm运行时,可横向扩展到300个子智能体、4000个协同步骤,并记录过12小时以上的长周期编码会话。开源权重以Modified MIT License发布在Hugging Face上。

规格速览

系列Kimi K2系列
参数量总计1T / 激活32B(MoE)
模态图像、视频、文本
语言多语言
上下文窗口256K token
许可协议Modified MIT(开源权重)

Kimi K2.7 Code基准测试

成绩来自Moonshot的K2.7发布博客,属厂商自报。独立第三方(Artificial Analysis、TokenMix)印证了这一相对排序。K2.7的幻觉率从K2.6的65%降到39%,在安全性和可靠性上是显著改进。

SWE-bench Pro厂商自报,胜过GPT-5.4和Opus 4.6
58.6
SWE-bench Verified厂商自报
80.2
Terminal-Bench 2.0Terminus-2框架
66.7
LiveCodeBench(v6)厂商自报
89.6
HLE(带工具)领先GPT-5.4和Opus 4.6
54.0
BrowseComp(Agent Swarm)高于K2.6的78.4
86.3
Artificial Analysis Intelligence Index总榜第4,开源权重里领先
54

Kimi K2.7 Code价格

服务商标价,按每100万token计。

输入$1.14
输出$4.80
缓存读取$0.19
缓存写入$1.14

Kimi K2.7 Code实际用起来怎么样

来自生产环境智能体运行的实际观察。

长上下文召回

在我们对Built-in阵容的内部评测中,它的长上下文召回最强。面对很长的智能体对话记录,Anthropic Sonnet已开始跑偏时它还能保持连贯。

智能体跑分

厂商自报的SWE-bench Pro 58.6,在撰写时是阵容里最高的,胜过GPT-5.4和Opus 4.6。

长周期编码

有记录的自主会话超过12小时,完成4000多次工具调用。这个模型在超长运行里确实能保持水准。

Kimi K2.7 Code最适合的智能体任务

必须翻遍所有旧会话的调查

翻完半年的Slack对话,找出客户流失的原因;梳理客服工单积压,找出反复出现的bug模式;或者把上百份RFC里的洞察串起来。在Anthropic Sonnet已经开始丢掉前面轮次的地方,K2.7的长上下文召回依然稳得住——「把一整堆都读完」这类工作流要的正是这个。

跑一整夜的自主重构

Moonshot记录过一次13小时的自主重构,对象是一套用了八年的撮合引擎,K2.7撑过4000多次工具调用而没有偏离任务。这种活儿,大多数模型跑到第二小时左右就忘了目标;K2.7在长周期上的稳定,才让「周五晚上启动,周一早上验收」真的行得通。

能处理截图和视频片段的多模态智能体

K2.7通过MoonViT同时接受图像和视频输入,这在Claude系列之外并不常见。适合以截图驱动的QA智能体、文档视觉流水线,以及任何原本得为了读图再接一个视觉模型的部署。

Kimi K2.7 Code与其他模型对比

Kimi K2.7 Code对比GLM-5.2

两者都是当下省钱的长上下文选项。K2.7 Code是Moonshot的默认模型,在多模态编码上更对路;GLM-5.2是Z.AI当前的默认模型,上下文窗口更大,有100万token。

Kimi K2.7 Code对比Claude Sonnet 4.6

Sonnet(×1)在英文多工具调用的可靠性上领先。K2.7(×0.3)赢在成本和智能体跑分(SWE-bench Pro)。搭配着用:复杂工具调用交给Sonnet,对成本敏感的智能体任务交给K2.7。

Kimi K2.7 Code对比DeepSeek V4 Pro

DeepSeek V4 Pro更便宜,上下文窗口也更大,有100万token。Kimi K2.7 Code是Moonshot原生、更强的代码路由,还带视觉输入。按提供方是否合适和任务形态来选。

结论:你该用Kimi K2.7 Code吗?

认真做智能体时,开源权重里的默认之选:长上下文,性价比高。相比Sonnet 4.6,仍有差距的地方是工具调用可靠性和企业支持。

常见问题

Kimi K2.7 Code是什么时候发布的?

Moonshot AI在2026年6月发布了Kimi K2.7 Code。开源权重以Modified MIT License发布在Hugging Face上。

上下文窗口有多大?

256K token。K2.7的差异化在于这个规模下的召回质量,而不是窗口本身的大小。超过约180K后召回开始下降(和其他256K模型类似)。

Kimi K2.7 Code和Claude Opus 4.6比怎么样?

在智能体跑分上(厂商自报)K2.7领先:SWE-bench Pro 58.6对Opus 4.6的53.4,带工具的HLE 54.0对53.0。Opus 4.6在安全表现和生产环境中英文工具调用的可靠性上仍有优势。

K2.7支持图像输入吗?

支持。K2.7接受图像和视频输入,输出仅文本。多模态智能体可以原生运行。

Kimi K2.7 Code在Okou上的可用情况

Kimi K2.7 Code已从Okou阵容中移除,因此在聊天和工作流里都无法再选用,也不能用你自己的API密钥接入。GPT 5.6 Luna覆盖同一个省钱档位。