Skip to content
登录/注册

Kimi K3 是一条面向复杂任务的旗舰推理路由,适合截图还原与交互式前端原型、大型代码仓库、多文档证据综合、长时间运行的智能体,以及确实需要 105 万 Token 工作上下文的知识任务。

上下文窗口1.1M
提供商Moonshot
创建时间2026/08/10

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入输出缓存命中
3.00/M15.00/M0.30/M

优选通道

综合优选链路,兼顾可用性、速度与日常生产调用。

输入输出缓存命中
3.00/M15.00/M0.30/M

介绍

输入
文本 图像
输出
文本

Kimi K3 API:2.8 万亿参数的开源前沿多模态旗舰

Kimi K3 是月之暗面(Moonshot AI)于 2026 年 7 月 16 日发布的超大规模混合专家(MoE)模型,总参数 2.8 万亿,是目前规模最大的开源权重模型,也是全球首个「开源 3T 级」模型。它原生支持文本、图像与视频理解,具备 100 万 token 上下文窗口和常驻思考模式(always-on thinking),并已于 7 月 27 日公开模型权重(修改版 MIT 许可)。

在编码评测中,Kimi K3 稳居第一梯队:SWE-bench Verified 达 76.8%,SWE Marathon 与 Program Bench 领先所有对手,LMArena 前端代码竞技场以 1679 Elo 排名第一。

海鲸AI 通过 OpenAI 兼容接口提供 Kimi K3,支持工具调用、流式输出、视觉理解与超长上下文处理。

获取 API 密钥 · 模型 ID:kimi-k3


为什么选择 Kimi K3

  • 最大的开源模型 —— 2.8 万亿总参数,比 DeepSeek V4 Pro 大约 75%,开源权重可私有化部署
  • 100 万 token 上下文 —— 全窗口统一计价,无长上下文加价档位
  • 原生多模态 —— 文本、图像、视频在同一个模型内理解,无需外挂适配器
  • 常驻思考模式 —— 每次回复都经过完整推理,复杂任务质量稳定
  • 架构创新 —— Kimi Delta Attention 线性注意力 + Attention Residuals,整体扩展效率较 K2 提升约 2.5 倍
  • 编码第一梯队 —— 六项编码基准均进前三,SWE Marathon 与 Program Bench 登顶

核心能力

01 智能体编码

这是 Kimi K3 最受关注的能力。它在 SWE-bench Verified 上取得 76.8%,SWE Marathon(42.0)超过 Opus 4.8 与 GPT-5.6 Sol,前端代码竞技场(LMArena Frontend Code Arena)以 1679 Elo 独立排名第一。

  • 仓库级 GitHub issue 定位与修复
  • 前端页面与交互实现
  • 长周期多步骤智能体任务

02 100 万 token 长上下文

上下文窗口 1,048,576 token,配合 Kimi Delta Attention 线性注意力,长序列下的效率随长度增长而优势放大;BrowseComp 长程检索任务在完整 1M 上下文下拿到 90.4 分。

  • 完整代码仓库一次装入
  • 超长文档与多资料交叉分析
  • 全窗口统一计价,无长上下文附加费

03 原生多模态理解

文本、图像、视频在同一个模型内原生处理,而不是通过独立的视觉适配器拼接,跨模态推理更连贯。

  • 截图 / 设计稿转代码
  • 视频内容理解与摘要
  • 图文混合文档分析

04 常驻推理与科学问答

思考模式始终开启,每次回复都包含完整推理过程(推理 token 按输出计费)。GPQA 研究生级科学问答达 93.5%。

  • 高难度数学与逻辑推理
  • 研究生级科学问题求解
  • 复杂决策链路分析

最佳使用场景

场景 说明
智能体编码 仓库级问题修复与端到端功能开发
前端开发 前端代码竞技场排名第一,设计稿还原能力强
长上下文分析 100 万 token 窗口内的大型项目与资料集理解
多模态任务 图像、视频与文本的统一理解
深度研究 长程网页检索与多步推理(BrowseComp 90.4)
私有化部署 权重公开(修改版 MIT),可本地化部署

Kimi K3 相比 K2 升级了什么

能力 Kimi K3 Kimi K2
总参数 2.8 万亿 1 万亿
上下文窗口 100 万 token 256K token
模态 文本 + 图像 + 视频 文本
思考模式 常驻开启 可选
注意力架构 Kimi Delta Attention + AttnRes 传统全量注意力
扩展效率 约 2.5 倍于 K2 基准

具体计费以页面上方的实时价格卡片为准。


如何使用 Kimi K3 API

1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。

2. 用好上下文缓存 K3 的常驻思考模式会产生推理 token(按输出计费),但编码类工作负载的缓存命中率普遍很高,多轮对话与智能体场景的实际成本远低于纸面单价。

3. 调用接口

curl -X POST https://api.atalk-ai.com/v1/chat/completions \
  -H 'Authorization: Bearer YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "user", "content": "阅读这个仓库,找出并修复导致内存泄漏的代码路径,补充回归测试。"}
    ],
    "stream": true
  }'

常见问题

Kimi K3 什么时候发布的? 2026 年 7 月 16 日发布,7 月 27 日公开模型权重,采用修改版 MIT 许可。

2.8 万亿参数会不会很贵? 不会。它是稀疏 MoE 架构(896 个专家中每 token 仅激活 16 个),并采用 MXFP4 量化感知训练,推理成本远低于同等规模的稠密模型。

编码能力到什么水平? 六项编码基准均进前三:SWE-bench Verified 76.8%,SWE Marathon 42.0(超过 Opus 4.8 与 GPT-5.6 Sol),前端代码竞技场独立排名第一。

思考模式可以关闭吗? 不可以。K3 的推理模式常驻开启,每次回复都包含推理过程,推理 token 按输出 token 计费。换来的是复杂任务上稳定的输出质量。

上下文和输出上限? 上下文 1,048,576 token(约 100 万),默认输出上限 131,072 token,可按需上调。全窗口统一计价,没有长上下文加价。

和 DeepSeek V4 Pro 怎么选? 两者都是开源 MoE 旗舰。K3 参数规模更大、原生多模态、上下文同为 1M;V4 Pro 输出上限更高(384K)。需要图像 / 视频理解或前端开发选 K3,纯文本超长输出场景可考虑 V4 Pro。


为什么选择海鲸AI 使用 Kimi K3 API

  • 免自建集群 —— 官方自部署需要 64 卡以上,海鲸AI 开箱即用
  • OpenAI 兼容接口 —— 现有代码改两行接入
  • 一个密钥多模型 —— K3 与 Claude、GPT、Gemini、DeepSeek 自由切换对比
  • 人民币结算 —— 国产模型按人民币计价,账目清晰

API

API 接入信息

Model ID在推理接口中指定模型
kimi-k3
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.atalk-ai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

kimi-k3 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

关于 provider 参数(可选,海鲸AI 扩展字段):同一模型通常有多条服务通道,价格与稳定性略有差异。在请求体中加入 provider 字段即可指定通道;不传该字段时由系统自动选择默认通道,不影响正常调用。

provider 并非 OpenAI 官方协议中的字段,而是海鲸AI 的扩展参数,仅在本平台生效。OpenAI SDK 允许透传此类自定义字段,用法见下方示例。

取值通道适用场景
direct直连通道官方直连链路,追求原生体验与完整上下文
stable优选通道兼顾可用性、速度,适合日常生产调用
economical特惠通道成本优先,适合批量处理与价格敏感业务

具体通道与对应价格以上方「定价」为准(各模型开通的通道可能不同)。补充说明:

  • 写法:"provider": { "channel": "direct" }
  • 若指定的通道该模型未开通,会自动回退到默认通道并正常返回,不会报错。
  • 使用官方 SDK 时:Python 需通过 extra_body 传入;Node.js 直接写在请求对象中即可透传,TypeScript 项目加一行 // @ts-expect-error 跳过类型检查。
js
curl https://api.atalk-ai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.atalk-ai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.atalk-ai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'kimi-k3',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}