从《Kimi K3 开源》一文搞懂:模型是什么、怎么跑起来、外面又套了什么
面向:非开发背景、做过 AI agent 项目、但想系统补齐 AI 架构认知 的读者
下面 7 个模块(0–6)就是本页的学习骨架。先建立「概念地图」,再按模块逐个击破,别一上来读论文 / 架构图。
| 模块 | 目标 | 核心概念 | 文章对应例子 | 给你的 actionable |
|---|---|---|---|---|
| 0 校准 | 搞懂文章主线 | 模型层 vs 系统层 | 全篇主线 | 复述:K3 开放模型层,价值在系统层 |
| 1 模型本体 | 明白「模型」是什么 | 参数、权重、开源 / 闭源、MoE、量化 | MoE 公司比喻、2.8T | 解释「为什么 2.8T ≠ 每次算 2.8T」 |
| 2 怎么跑起来 | 本地 vs 云端 | 推理 vs 训练、Ollama、GPU 集群 / API、token 成本 | Mac mini 算式、64 节点 | 分清什么模型你能本地免费用 |
| 3 模型外的系统 | 理解「壳」为什么重要 | harness:工具 / 上下文 / 循环 / 状态 / 确认 | Bench 72.9 vs 73.7、游戏循环 | 复盘你做过的 agent 哪些是 harness |
| 4 产品与护城河 | 学会判断 AI 产品 | 「模型即产品」是暴言 | Slack / Notion 案例 | 选工具多问:能看 / 做 / 谁拍板 |
| 5 回到你的项目 | 用新语言复盘 | 嵌入功能 vs 卖推理 | K3 许可证两类业务 | 想一个你能嵌入开源模型的功能点 |
| 6(可选)动手 | 体验而非空学 | 本地推理、看一个 harness | Ollama 跑小模型 | 装 Ollama 跑 7B,亲历免 token 推理 |
这里的「开源」特指 开放权重(open weights):把训练好的模型参数公开,任何人可查看 / 部署 / 修改 / 做衍生品。
关键澄清:「任何人都可以」= 权利上的开放,不等于「你一台电脑能跑」。就像开源软件你能拿到源码,但编译运行仍需环境。读文章要分清它开放的是哪一层:
模型层(K3 开放权重)系统层(Codex Security 开放 harness 代码,Apache-2.0,但模型 GPT-5.6 仍闭源)
参数是模型里的「可调数字」;权重是训练后固定下来的那些数字(存成 safetensors 文件)。K3 总参数 2.8 万亿,仓库 1.56 TB、96 个分片、单片约 16 GB。
把模型想象成一家公司:共 896 个专业部门,但每处理一个 token 只根据任务叫来 16 个部门 + 共享专家。每次实际计算约 1040 亿参数,而非完整 2.8 万亿——成本大降,但整栋楼(全部权重)必须存在。
误区:MoE 降低的是「每步推理计算量」,不是「总权重体积」——896 个专家权重必须全部存着并在机器间快速调度。所以「每次算得少 ≠ 存得少」。
用更低精度压缩模型:K3 用 MXFP4 权重 + MXFP8 激活进一步压体积、提效率。量化让「存 / 算」更省,但官方仍建议 64+ 加速器节点。
token = 模型处理的「词片段」单位(中英切法不同)。上下文窗口(K3 = 100 万 token)是单次能「看 / 记」的量。窗口大 ≠ 全塞满最优——要 harness 决定何时压缩、保留、遗忘(K3 在 30 万 token 处主动压缩)。
你「下载来跑」叫 推理(用模型生成);训练 / 微调是另一回事(更贵,要更多卡)。开源权重通常指能推理 / 微调,不一定是能从头重训。
小模型(DeepSeek-R1 蒸馏版 7B / 14B)一台 Mac mini + Ollama,完全离线、免费、免 token——真的「下载即用」。
大模型不行:K3 的 2.8T 仓库约 1.56 TB,需 25+ 台 Mac mini 才装下内存,且没高带宽互连跑不起来 → 自部署变成机房工程。所以「下载 ≠ 免费用」只适用于小模型。
云端 = 云厂商有 GPU 集群(64+ 加速器超级节点),能跑大模型,再以 API 提供给开发者。
普通人不用下载 1.56 TB、不用管 64 张卡,而是在各种产品里「间接遇见」K3(按需调用、按 token 付费)。意义:把重资产集中托管,降低门槛;代价:每次调用付 token 费、且数据出网。
注意:若工具本身要调云端 API(如 Codex Security 调 GPT-5.6),仍要 token / 账号——即使它的 harness 代码是开源的。
小模型从大模型「学出来」:DeepSeek-R1 同时发布 1.5B / 7B / 8B / 14B / 32B / 70B 蒸馏版,一台 Mac mini 就能跑 7B / 14B。K3 目前只开放 2.8T 完整权重,没有官方从小到大蒸馏系列。
模型外面的 系统层包含:
同一 K3 在 Kimi Code 得 72.9、放进 Claude Code 得 73.7——权重没变,变的是周围的工具 / 提示 / 上下文 / 执行循环。你做 agent 项目时接触的工具调用、重试、上下文,就是 harness 的一部分。
「模型即产品」越来越像个暴言——前沿模型到用户之间,始终隔着一整套系统。一个只把模型直接暴露给用户的「产品」,几乎没有护城河:竞争对手可以换上同一个(甚至更好的)模型,你的差异瞬间归零。
护城河 = 系统层 + 数据 + 集成 + 工作流 + 分发,而不在权重本身。
面对一个 AI 工具,多问三句:
答得越清楚,护城河越实在,工具也越值得信赖。
K3 的开源许可证把业务分成两类,正好对应你做产品时的两种姿势:
结论:模型是商品、可互换;你的 harness 才是资产。
想一个你能把开源模型「嵌进去」的功能点(如本地摘要、分类、信息抽取),既降 token 成本、又避免数据出网——这就是「嵌入功能」思路的最小落地。
Ollama → 拉一个 7B 小模型(如 ollama run deepseek-r1:7b)→ 亲历「下载即用、离线免费」。ai-system-logic-guide.html)讲 「怎么跟模型对话 / 设计接口 / 用 Rubric 验收」(prompt / context 层思路);本页讲 「模型本身是什么、怎么跑、外面套什么」(模型层 + 系统层)。两本互补:一本管「你定义的输入输出结构」,一本管「你跑的是哪类模型、在哪跑、被什么系统包裹」。