Skip to main content
基准测试是一项对稳定性要求极高的工程任务。 您需要与模型进行大量交互,即使是微小的系统偏差或网络波动也可能影响结果的准确性。 我们总结了以下最佳实践,帮助您的评估结果可复现且可信。 重点提示:
  • 对于下表中未提到的 benchmark 或其他闭源 benchmark,推荐 temperature = 1.0,stream = true,top_p = 0.95
  • Reasoning 相关的 benchmark: maxtoken 推荐设置到 128k,并且总测试题量至少要到 500-1000 题才会获得一个相对低的测试方差。(比如 AIME2025 建议测试 32 次 30*32=960 题)
  • Code 相关的 benchmark:maxtoken 推荐设置到 256k
  • Agentic Task 相关的 benchmark:如果需要 multi hop search,maxtoken 推荐设置到 256k 并配合 context management 机制;其他类型的 agentic task 推荐至少设置 16-64k 的 maxtoken

K2.6 模型基准测试推荐参数

Benchmark 分类BenchmarkTemperatureMax token 推荐设置推荐测试次数Top-P其他
Multi-modalMMMU-Pro推荐设置:1.0max tokens = 96k3次top_p=0.95thinking=
MMMU-Pro w/ python推荐设置:1.0per step tokens = 64k;
total max tokens = 256k
3次top_p=0.95推荐max steps = 50
thinking=
CharXiv (RQ)推荐设置:1.0max tokens = 96k3次top_p=0.95thinking=
CharXiv (RQ) w/ python推荐设置:1.0per step tokens = 64k;
total max tokens = 256k
3次top_p=0.95推荐max steps = 50
thinking=
MathVision推荐设置:1.0max tokens = 96k3次top_p=0.95thinking=
MathVision w/ python推荐设置:1.0per step tokens = 64k;
total max tokens = 256k
3次top_p=0.95推荐max steps = 50
thinking=
V* w/ python推荐设置:1.0per step tokens = 64k;
total max tokens = 256k
3次top_p=0.95推荐max steps = 50
thinking=
AgentHLE-Full w/ tools推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
1次top_p=0.95推荐max steps = 300
thinking=
BrowseComp推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
1次top_p=0.95推荐max steps = 300
thinking=
DeepSearchQA推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
1次top_p=0.95推荐max steps = 300
thinking=
WideSearch推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
4次top_p=0.95推荐max steps = 300
thinking=
Toolathlon推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
4次top_p=0.95推荐max steps = 300
thinking=
MCPMark推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
4次top_p=0.95推荐max steps = 300
thinking=
Claw Eval推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
4次top_p=0.95推荐max steps = 300
thinking=
APEX-Agents推荐设置:1.0per step tokens = 48k;
total max tokens = 256k
4次top_p=0.95推荐max steps = 300
thinking=
CodingTerminal-Bench 2.0 (Terminus-2)推荐设置:1.0max tokens = 256k3次top_p=0.95thinking=
SWE-Bench Pro推荐设置:1.0per step tokens = 32k;
total max tokens = 256k
5次top_p=0.95推荐max steps = 300
thinking=
SWE-Bench Multilingual推荐设置:1.0per step tokens = 32k;
total max tokens = 256k
5次top_p=0.95推荐max steps = 300
thinking=
SWE-Bench Verified推荐设置:1.0per step tokens = 32k;
total max tokens = 256k
5次top_p=0.95推荐max steps = 300
thinking=
SciCode推荐设置:1.0max tokens = 96k4次top_p=0.95thinking=
OJBench (python)推荐设置:1.0max tokens = 96k8次top_p=0.95thinking=
LiveCodeBench (v6)推荐设置:1.0max tokens = 96k1次top_p=0.95thinking=
MathAIME 2026推荐设置:1.0max tokens = 96k32次top_p=0.95thinking=
HMMT 2026 (Feb)推荐设置:1.0max tokens = 96k32次top_p=0.95thinking=
IMO-AnswerBench推荐设置:1.0max tokens = 96k4次top_p=0.95thinking=
KnowledgeHLE-Full推荐设置:1.0max tokens = 96k1次top_p=0.95thinking=
GPQA-Diamond推荐设置:1.0max tokens = 96k8次top_p=0.95thinking=

API 推荐参数与注意事项

  • 强烈推荐使用官方 API 来做 benchmark 测试,部分第三方 API 可能存在精度偏差
  • 使用推荐的模型进行测试:
    • 对于 K2.6:使用 kimi-k2.6 进行测试
  • 必须设置: stream = true
    • 非流式模式可能会导致随机的连接中断,难以控制
  • 当前 API 默认设置:
    • Kimi K2.6:
      • default max_tokens = 32768
      • default thinking = {"type": "enabled", "keep": null}
      • default temperature = 1.0
      • default top_p = 0.95
      • default n = 1
      • default presence_penalty = 0.0
      • default frequency_penalty = 0.0
  • 超时设置:
    • 使用 stream = false 时,api.moonshot.cn 超时时间为 2 小时,但某些 ISP 可能会提前终止连接
    • 因此我们建议您设置 stream = true
  • 并发控制:
    • 保持较低的并发数以避免速率限制
  • 重试逻辑 是必须的:
    • 处理服务器过载情况
    • 处理因随机服务器问题导致的意外完成原因
    • 处理复杂的网络问题

FAQ

Q1: temperature 取值对不同模型是一致的吗? A: 不同模型系列的 temperature 设置不同:
  • k2.6 模型:temperature = 1.0
Q2: 为什么要用 stream=true? A: 长输出可能需要若干分钟。 空闲的TCP连接有可能会被防火墙、负载均衡器和NAT网关等各种中间网络设备终止。 流式传输能保持连接活跃,显著提高可靠性。 生产数据显示,stream=false 的请求失败率远高于 stream=true。 Q3: 我应该使用多少并发数? A: 您的API账户有特定的速率限制,参考充值与限速说明。 建议从较低的并发数开始。 如果遇到限流导致的 429 错误,则说明并发过高。 评估的准确性比速度更重要,请找到一个能让您保持在速率限制内合适的并发水平。 Q5: 为什么要重试某些错误? A: 即使使用流式传输,发起请求时仍可能因为网络抖动等问题导致失败。 请对临时性故障(网络问题、服务器过载、速率限制)进行重试,以避免不必要的错误。 Q6: 为什么多轮对话和多步骤任务必须带上完整上下文和思考过程? A: 完整上下文能帮助模型在多步推理过程中保持推理的连贯性,特别是在工具调用过程中。 如果省略思考过程,后续回复可能会不一致或质量下降,从而影响性能评估的准确性。

联系我们

如果您遇到任何问题,请发送邮件至 api-service@moonshot.ai 获得进一步的技术支持。