Skip to content

模型配置

本页介绍 Kimi Code 提供的模型,以及如何在各客户端之间切换。

模型总览

Kimi Code 目前提供 Kimi K3 与 Kimi K2.7 Code 两个模型、共 4 个模型 ID,可在客户端或第三方工具中按模型 ID 选择。各模型规格对比如下:

模型上新推荐

k3-256k全新上线,256k上下文内效果相同, k3(1M)消耗约为 k3-256k 两倍,适合日常问答、代码补全、常规功能开发、单文件或少量文件修场景,不支持视频输入。

💓 温馨提示

K3(1M)切换至 K3-256k: 如果当前会话的上下文已超过 256k,部分 coding 工具如 Kimi Code CLI、Claude Code 会在工具侧直接进行 compact 命令。

切换建议:
(1)考虑到不同 agent 工具的处理方式不同,切换前先手动执行一次 compact,将上下文压缩至 256k 以内。这样既能保留任务要点、会话不断档,切换后还能享受更耐用的额度。
(2)若历史上下文中包含视频文件,由于 K3-256k 不支持视频输入,直接切换将报错,请先 compact 再切换。

K3-256k 切换至 K3(1M): 从 K3-256k 切换至 K3(1M)时,如果 K3-256k 接近 256k 上限,您不希望 compact 丢失信息,可以直接切换到 1M,当前版本从 256k 切换到 1M 不会影响缓存。

Model IDk3k3-256kkimi-for-codingkimi-for-coding-highspeed
模型版本Kimi K3Kimi K3Kimi K2.7 CodeK2.7 Code HighSpeed
说明Kimi 最强旗舰编程模型,2.8T 参数规模,1M 上下文窗口Kimi K3 的 256K 上下文版本,有效降低消耗擅长代码补全与常规开发任务K2.7 Code 的高速版,编码能力一致,输出速度约为普通版 5–6 倍
速度常规速度常规速度常规速度高速版(6 倍速 3 倍消耗)
上下文窗口最高 1M(面向高档位会员)仅 256k256k256k
思考程度reasoning_effort:low / high / max
(默认 high
reasoning_effort:low / high / max(默认 highThinking:ONThinking:ON
调用限制Moderato 档位以上可调用,Allegretto 以上支持 1M 上下文Moderato 及以上会员均可调用所有会员可用Allegretto 档位以上
多模态输入支持图片、视频仅图片图片、视频图片、视频

需要更高档位的会员套餐?

不同会员套餐解锁不同的模型、上下文与速度能力,可 前往升级订阅 →

为什么新模型上线后消耗变多了?

切换模型后,之前建立的上下文缓存 (cache) 在新模型上不再命中,这部分上下文需要重新预填充 (prefill)。因此刚切到新模型时消耗会偏高。建议操作:

  • 新开 session 再使用新模型:能让效果更好、消耗更少。
为什么模型 ID 写对了还是报 401?

当请求的能力超出当前套餐权限时,服务端会返回 401,常见三种情况:

  • 无 K3 调用权限:套餐低于 Moderato 时无法调用 k3k3-256k,需升级至 Moderato 及以上。
  • 无 1M 权限:Moderato 套餐用户调用 k3 时支持最高 256K 上下文;Allegretto 及更高档位支持最高 1M 上下文。调用 k3-256k 时上下文上限固定为 256K。
  • 无高速版权限:部分套餐不含高速版,升级至 Allegretto 及更高档位套餐即可调用 kimi-for-coding-highspeed

完整报错文案与处理方式详见 错误参考

为什么高速版提速不明显?

两个常见原因:

  • 模型 ID 填错:高速版 ID 必须是 kimi-for-coding-highspeed,填错会兜底到标准版 kimi-for-coding,不报错也不加速。
  • 工具与脚本占了大头:高速版只加快模型输出;一次任务里工具调用(读写文件、执行命令等)与脚本执行的耗时不受影响,这部分占比大时整体提速就不明显。
如何减少因思考程度切换带来的消耗?

切换思考程度(effort)会让已建立的上下文缓存(cache)失效,原本能命中缓存的上下文需要重新预填充(prefill)。为避免频繁触发重新预填充:

  • 根据任务复杂度选定思考程度后,在同一会话内尽量保持一致;
  • 确需改用不同思考程度时,新建会话再切换,而不是在长会话里反复切换。

如何切换模型

使用注意

  • 切换 model id 时建议开启新对话:切换模型会使已建立的缓存失效。建议开启新会话,避免产生额外 token 消耗的同时获得更好体验。
  • 填写 Model ID,不是模型版本名:调用模型时需要填写上表中的 Model ID(如 k3k3-256kkimi-for-codingkimi-for-coding-highspeed),如果填写成模型版本名(如 Kimi K3K2.7 Code),会调用失败。
  • K3 / K2.7 关闭 thinking 会被路由到 K2.6:若需使用 K3 或 K2.7 Code,请保持 thinking 开启;关闭 thinking 后请求会被路由到 K2.6。

切换到目标模型的方式:

官方客户端

  • 官方 Kimi Code CLI:输入 /model 即可切换模型,无需修改配置;列表里暂未出现最新模型时,/logout 后重新 /login 即可。
  • Kimi Code for VS Code:在输入栏下拉菜单中选择目标模型;若目标模型还没出现,重启 VS Code 或重新安装插件即可。

第三方工具

把工具里的 Model ID 配置为目标模型即可。详细步骤如下:

  1. Kimi Code 控制台 创建 API Key。
  2. 在工具中填入 Base URL 和相应模型 ID。

Kimi Code API 同时兼容 OpenAI 和 Anthropic 两种协议,Base URL 如下:

协议Base URL
OpenAI 兼容https://api.kimi.com/coding/v1
Anthropic 兼容https://api.kimi.com/coding/

详细配置步骤请参考对应工具的接入文档:

在第三方工具中使用 K3 前请注意

K3 的接入配置与 K2.7 Code 略有不同,使用前请确认以下两点:

  • 上下文窗口:部分工具默认的上下文窗口并非最高 1M,需手动将上下文窗口字段配置为 1048576,才能用满 K3 的最高 1M 上下文。
  • 思考程度(effort):K3 支持 low / high / max 三档;工具传入的 effort 会按下表映射:
# 默认
null / undefined       → high
其它未知取值            → HTTP 400 请求报错

# → max
ultra / max / xhigh    → max

# → high(推荐)
high / medium          → high

# → low
low / minimum / light  → low

# → 关闭思考
none                   → thinking.type disabled