Kimi K3 模型介绍
Kimi K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。 完整 Benchmark 与案例请参考 技术博客 。Kimi 目前正与推理合作伙伴和开源维护者密切协作,对齐技术细节,确保模型能在整个生态中可靠上线。完整模型权重将于 2026 年 7 月 27 日前发布。关于架构、训练和评测的更多细节,将随 Kimi K3 技术报告一同公布。3 万亿级开源模型
Kimi K3 是首个达到 2.8 万亿参数规模的开源模型。这是 Kimi 持续推进模型规模边界的最新一步:在过去 12 个月(2025/07–2026/07)中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。

编程
Kimi K3 具备很强的长程编码能力。在极少人工监督的情况下,它可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。 Kimi K3 也擅长结合软件工程与视觉推理的任务。它能够利用截图和视觉反馈,优化游戏开发、前端和 CAD 等场景。知识工作
Kimi K3 推动了端到端知识工作的进展。除了公开基准外,Kimi K3(max)在我们的内部评测中也展现出稳定提升。这些评测来自真实用户与智能体协作流程中反复出现的任务模式和挑战。Kimi K3 在不同生产场景导向的工作流中都表现出一致优势,说明其智能体知识工作能力得到了全面提升。访问条件
Kimi K3 是旗舰模型:在开放平台完成充值(最低充值金额 10 元)后即可解锁调用。新用户注册认证赠送的 15 元代金券不可用于 Kimi K3。 累计充值金额同时决定账户等级与速率限制(并发、RPM、TPM、TPD),详见 充值与限速 。立即开始
以下示例需要 Python 3.9+ 和 OpenAI SDK。先安装 SDK,并初始化一次客户端;后续 Python 示例复用client。
基础调用
- Python
- cURL
推理强度
K3 始终开启思考模式,并支持通过请求顶层reasoning_effort 配置推理强度。
推理强度支持
low / high / max 三档(默认 max)。用法见 推理强度 。多轮对话和工具调用时,将 API 返回的完整 assistant message 原样加入下一次请求,不要只保留
content。流式输出
流式响应分别提供推理增量reasoning_content 和最终答案增量 content。更多细节见 流式输出 。
视觉输入
视觉消息的content 必须是对象数组,而不是序列化后的字符串。完整格式与限制见 视觉输入 。
- 本地图片
- 视频文件
结构化输出
使用json_schema 和 strict: true 约束最终 message.content,只解析该字段,不解析 reasoning_content。
姓名与年龄 schema
姓名与年龄 schema
Partial Mode
在消息末尾添加partial=True 的 assistant message,让模型从指定文本前缀继续生成。最终展示时需要自行拼接前缀。
自定义工具与 tool_choice
首轮用 tool_choice="required" 强制至少调用一个工具。执行每个调用后,回传完整 assistant message,并用对应的 tool_call_id 逐条追加工具结果。
最小天气 Agent Loop
最小天气 Agent Loop
动态加载工具
把完整工具定义放进一条不含content 的 system message,即可从该位置起加载工具。
动态加载计算器
动态加载计算器
- 工具定义必须包含完整的
name、description和parameters。 - 声明从该 message 所在位置起生效。
- 后续请求仍需在历史中携带该 message,服务端不会保存声明。
1M 上下文与自动缓存
当前一个请求的 prompt tokens 大于 256 时,新的请求才能命中前缀缓存;当前一个请求的 prompt tokens 小于 256 时,请求不会被缓存而是被丢弃。详见 上下文缓存 。
官方工具
官方工具通过 Formula 接入:- 从 Formula 的
/tools接口获取工具定义。 - 将定义加入 Chat Completions 请求的
tools。 - 收到
tool_calls后,将对应函数名和参数提交到 Formula 的/fibers接口。 - 将完整 assistant message 和 Fiber 输出作为对应的 tool message 加入历史。
- 再次调用 Chat Completions,直到模型返回最终答案。
重要限制
- 推理强度通过请求顶层
reasoning_effort配置,支持low/high/max(默认max);K3 始终开启思考模式。 max_completion_tokens默认 131072,最大可设置为 1048576。temperature=1.0、top_p=0.95、n=1、presence_penalty=0、frequency_penalty=0为固定值,建议不要显式传入。- 多轮对话和工具调用必须原样回传完整 assistant message。
- 视觉输入不支持公网图片 URL;请使用 base64 或
ms://<file-id>,并确保content是对象数组。 - 联网搜索正在更新,近期不建议用于生产流程。
常见问题
Kimi K3 如何计费?
Kimi K3 如何计费?
Kimi K3 上下文长度为 1M tokens,计费不按上下文长度分段:所有用量均按量付费,输入(区分缓存命中与未命中)与输出分别按统一单价计费,详见 Kimi K3 定价 。
新用户赠送的 15 元代金券可以体验 Kimi K3 吗?
新用户赠送的 15 元代金券可以体验 Kimi K3 吗?
不可以。模型发布后,国内注册并完成认证的用户获赠的 15 元代金券不可用于体验 Kimi K3,请充值后解锁使用。
Kimi K3 的思维链怎么关?
Kimi K3 的思维链怎么关?
目前关不了,K3 始终开启思考模式。如果觉得思考过程太长,可以将
reasoning_effort 设置为 low 降低推理强度,详见 推理强度。模型价格
关于 token 价格,详见 产品定价 。相关文档
推理强度
配置 reasoning_effort。
视觉输入
发送图片与视频。
结构化输出
使用严格 JSON Schema。
Partial Mode
从指定前缀继续生成。
工具调用约束
控制模型是否调用工具。
动态加载工具
按需注入工具定义。
工具调用最佳实践
组合工具调用能力。
官方工具
接入 Formula 工具。
Kimi K3 定价
查看输入与输出价格。