模型配置
本页介绍 Kimi Code 提供的模型,以及如何在各客户端之间切换。
模型总览
Kimi Code 目前提供 Kimi K3 与 Kimi K2.7 Code 两个模型、共 4 个模型 ID,可在客户端或第三方工具中按模型 ID 选择。各模型规格对比如下:
模型上新推荐
k3-256k全新上线,256k上下文内效果相同, k3(1M)消耗约为 k3-256k 两倍,适合日常问答、代码补全、常规功能开发、单文件或少量文件修场景,不支持视频输入。
💓 温馨提示
K3(1M)切换至 K3-256k: 如果当前会话的上下文已超过 256k,部分 coding 工具如 Kimi Code CLI、Claude Code 会在工具侧直接进行 compact 命令。
切换建议:
(1)考虑到不同 agent 工具的处理方式不同,切换前先手动执行一次 compact,将上下文压缩至 256k 以内。这样既能保留任务要点、会话不断档,切换后还能享受更耐用的额度。
(2)若历史上下文中包含视频文件,由于 K3-256k 不支持视频输入,直接切换将报错,请先 compact 再切换。K3-256k 切换至 K3(1M): 从 K3-256k 切换至 K3(1M)时,如果 K3-256k 接近 256k 上限,您不希望 compact 丢失信息,可以直接切换到 1M,当前版本从 256k 切换到 1M 不会影响缓存。
| Model ID | k3 | k3-256k | kimi-for-coding | kimi-for-coding-highspeed |
|---|---|---|---|---|
| 模型版本 | Kimi K3 | Kimi K3 | Kimi K2.7 Code | K2.7 Code HighSpeed |
| 说明 | Kimi 最强旗舰编程模型,2.8T 参数规模,1M 上下文窗口 | Kimi K3 的 256K 上下文版本,有效降低消耗 | 擅长代码补全与常规开发任务 | K2.7 Code 的高速版,编码能力一致,输出速度约为普通版 5–6 倍 |
| 速度 | 常规速度 | 常规速度 | 常规速度 | 高速版(6 倍速 3 倍消耗) |
| 上下文窗口 | 最高 1M(面向高档位会员) | 仅 256k | 256k | 256k |
| 思考程度 | reasoning_effort:low / high / max(默认 high) | reasoning_effort:low / high / max(默认 high) | Thinking:ON | Thinking:ON |
| 调用限制 | Moderato 档位以上可调用,Allegretto 以上支持 1M 上下文 | Moderato 及以上会员均可调用 | 所有会员可用 | Allegretto 档位以上 |
| 多模态输入支持 | 图片、视频 | 仅图片 | 图片、视频 | 图片、视频 |
需要更高档位的会员套餐?
不同会员套餐解锁不同的模型、上下文与速度能力,可 前往升级订阅 →。
为什么新模型上线后消耗变多了?
切换模型后,之前建立的上下文缓存 (cache) 在新模型上不再命中,这部分上下文需要重新预填充 (prefill)。因此刚切到新模型时消耗会偏高。建议操作:
- 新开 session 再使用新模型:能让效果更好、消耗更少。
为什么模型 ID 写对了还是报 401?
当请求的能力超出当前套餐权限时,服务端会返回 401,常见三种情况:
- 无 K3 调用权限:套餐低于 Moderato 时无法调用
k3、k3-256k,需升级至 Moderato 及以上。 - 无 1M 权限:Moderato 套餐用户调用
k3时支持最高 256K 上下文;Allegretto 及更高档位支持最高 1M 上下文。调用k3-256k时上下文上限固定为 256K。 - 无高速版权限:部分套餐不含高速版,升级至 Allegretto 及更高档位套餐即可调用
kimi-for-coding-highspeed。
完整报错文案与处理方式详见 错误参考。
为什么高速版提速不明显?
两个常见原因:
- 模型 ID 填错:高速版 ID 必须是
kimi-for-coding-highspeed,填错会兜底到标准版kimi-for-coding,不报错也不加速。 - 工具与脚本占了大头:高速版只加快模型输出;一次任务里工具调用(读写文件、执行命令等)与脚本执行的耗时不受影响,这部分占比大时整体提速就不明显。
如何减少因思考程度切换带来的消耗?
切换思考程度(effort)会让已建立的上下文缓存(cache)失效,原本能命中缓存的上下文需要重新预填充(prefill)。为避免频繁触发重新预填充:
- 根据任务复杂度选定思考程度后,在同一会话内尽量保持一致;
- 确需改用不同思考程度时,新建会话再切换,而不是在长会话里反复切换。
如何切换模型
使用注意
- 切换 model id 时建议开启新对话:切换模型会使已建立的缓存失效。建议开启新会话,避免产生额外 token 消耗的同时获得更好体验。
- 填写 Model ID,不是模型版本名:调用模型时需要填写上表中的 Model ID(如
k3、k3-256k、kimi-for-coding、kimi-for-coding-highspeed),如果填写成模型版本名(如Kimi K3、K2.7 Code),会调用失败。 - K3 / K2.7 关闭 thinking 会被路由到 K2.6:若需使用 K3 或 K2.7 Code,请保持 thinking 开启;关闭 thinking 后请求会被路由到 K2.6。
切换到目标模型的方式:
官方客户端
- 官方 Kimi Code CLI:输入
/model即可切换模型,无需修改配置;列表里暂未出现最新模型时,/logout后重新/login即可。 - Kimi Code for VS Code:在输入栏下拉菜单中选择目标模型;若目标模型还没出现,重启 VS Code 或重新安装插件即可。
第三方工具
把工具里的 Model ID 配置为目标模型即可。详细步骤如下:
- 在 Kimi Code 控制台 创建 API Key。
- 在工具中填入 Base URL 和相应模型 ID。
Kimi Code API 同时兼容 OpenAI 和 Anthropic 两种协议,Base URL 如下:
| 协议 | Base URL |
|---|---|
| OpenAI 兼容 | https://api.kimi.com/coding/v1 |
| Anthropic 兼容 | https://api.kimi.com/coding/ |
详细配置步骤请参考对应工具的接入文档:
在第三方工具中使用 K3 前请注意
K3 的接入配置与 K2.7 Code 略有不同,使用前请确认以下两点:
- 上下文窗口:部分工具默认的上下文窗口并非最高 1M,需手动将上下文窗口字段配置为
1048576,才能用满 K3 的最高 1M 上下文。 - 思考程度(effort):K3 支持
low/high/max三档;工具传入的 effort 会按下表映射:
# 默认
null / undefined → high
其它未知取值 → HTTP 400 请求报错
# → max
ultra / max / xhigh → max
# → high(推荐)
high / medium → high
# → low
low / minimum / light → low
# → 关闭思考
none → thinking.type disabled