AI 模型层 · 系统逻辑入门

从《Kimi K3 开源》一文搞懂:模型是什么、怎么跑起来、外面又套了什么

面向:非开发背景、做过 AI agent 项目、但想系统补齐 AI 架构认知 的读者

来源文章:APPSO《Kimi K3 开源最大的好处,不是给你下载来用》(2026-07-29)· 本页为学习笔记与概念拆解,非原文转载。

0 · 校准:一篇文章在讲什么

核心命题:Kimi K3 开放的是 「模型层」(权重文件),但真正对普通用户有价值的,是它之外的 「系统层」(harness / 壳)。
文章用两个工整的镜像点破「开源」的两种打开方式: 结论:「模型即产品」越来越像个暴言——前沿模型到用户之间,始终隔着一整套系统。

学习大纲:模块化路线图

下面 7 个模块(0–6)就是本页的学习骨架。先建立「概念地图」,再按模块逐个击破,别一上来读论文 / 架构图。

模块目标核心概念文章对应例子给你的 actionable
0 校准搞懂文章主线模型层 vs 系统层全篇主线复述:K3 开放模型层,价值在系统层
1 模型本体明白「模型」是什么参数、权重、开源 / 闭源、MoE、量化MoE 公司比喻、2.8T解释「为什么 2.8T ≠ 每次算 2.8T」
2 怎么跑起来本地 vs 云端推理 vs 训练、Ollama、GPU 集群 / API、token 成本Mac mini 算式、64 节点分清什么模型你能本地免费用
3 模型外的系统理解「壳」为什么重要harness:工具 / 上下文 / 循环 / 状态 / 确认Bench 72.9 vs 73.7、游戏循环复盘你做过的 agent 哪些是 harness
4 产品与护城河学会判断 AI 产品「模型即产品」是暴言Slack / Notion 案例选工具多问:能看 / 做 / 谁拍板
5 回到你的项目用新语言复盘嵌入功能 vs 卖推理K3 许可证两类业务想一个你能嵌入开源模型的功能点
6(可选)动手体验而非空学本地推理、看一个 harnessOllama 跑小模型装 Ollama 跑 7B,亲历免 token 推理

1 · 模型本体:模型到底是什么

① 开源 / 闭源:开放的是哪一层

这里的「开源」特指 开放权重(open weights):把训练好的模型参数公开,任何人可查看 / 部署 / 修改 / 做衍生品。

关键澄清:「任何人都可以」= 权利上的开放不等于「你一台电脑能跑」。就像开源软件你能拿到源码,但编译运行仍需环境。读文章要分清它开放的是哪一层:

模型层(K3 开放权重)系统层(Codex Security 开放 harness 代码,Apache-2.0,但模型 GPT-5.6 仍闭源)

② 权重 / 参数 / 2.8T

参数是模型里的「可调数字」;权重是训练后固定下来的那些数字(存成 safetensors 文件)。K3 总参数 2.8 万亿,仓库 1.56 TB、96 个分片、单片约 16 GB。

③ MoE 混合专家(公司比喻)

把模型想象成一家公司:共 896 个专业部门,但每处理一个 token 只根据任务叫来 16 个部门 + 共享专家。每次实际计算约 1040 亿参数,而非完整 2.8 万亿——成本大降,但整栋楼(全部权重)必须存在

误区:MoE 降低的是「每步推理计算量」,不是「总权重体积」——896 个专家权重必须全部存着并在机器间快速调度。所以「每次算得少 ≠ 存得少」。

④ 量化(Quantization)

用更低精度压缩模型:K3 用 MXFP4 权重 + MXFP8 激活进一步压体积、提效率。量化让「存 / 算」更省,但官方仍建议 64+ 加速器节点。

2 · 怎么跑起来:本地 vs 云端

① token 与上下文窗口

token = 模型处理的「词片段」单位(中英切法不同)。上下文窗口(K3 = 100 万 token)是单次能「看 / 记」的量。窗口大 ≠ 全塞满最优——要 harness 决定何时压缩、保留、遗忘(K3 在 30 万 token 处主动压缩)。

② 推理 vs 训练

你「下载来跑」叫 推理(用模型生成);训练 / 微调是另一回事(更贵,要更多卡)。开源权重通常指能推理 / 微调,不一定是能从头重训。

③ 本地跑:小模型免 token(Ollama + Mac mini)

小模型(DeepSeek-R1 蒸馏版 7B / 14B)一台 Mac mini + Ollama,完全离线、免费、免 token——真的「下载即用」。

大模型不行:K3 的 2.8T 仓库约 1.56 TB,需 25+ 台 Mac mini 才装下内存,且没高带宽互连跑不起来 → 自部署变成机房工程。所以「下载 ≠ 免费用」只适用于小模型。

④ 云端跑:GPU 集群 / API / token 成本

云端 = 云厂商有 GPU 集群(64+ 加速器超级节点),能跑大模型,再以 API 提供给开发者。

普通人不用下载 1.56 TB、不用管 64 张卡,而是在各种产品里「间接遇见」K3(按需调用、按 token 付费)。意义:把重资产集中托管,降低门槛;代价:每次调用付 token 费、且数据出网。

注意:若工具本身要调云端 API(如 Codex Security 调 GPT-5.6),仍要 token / 账号——即使它的 harness 代码是开源的。

⑤ 蒸馏(Distillation)

小模型从大模型「学出来」:DeepSeek-R1 同时发布 1.5B / 7B / 8B / 14B / 32B / 70B 蒸馏版,一台 Mac mini 就能跑 7B / 14B。K3 目前只开放 2.8T 完整权重,没有官方从小到大蒸馏系列。

3 · 模型外的系统:harness / 壳

harness 七要素(最关键的认知升级)

模型外面的 系统层包含:

同一 K3 在 Kimi Code 得 72.9、放进 Claude Code 得 73.7——权重没变,变的是周围的工具 / 提示 / 上下文 / 执行循环。你做 agent 项目时接触的工具调用、重试、上下文,就是 harness 的一部分。

一句话:模型提供「潜在能力」,harness 把能力「组织成流程」。判断一个 AI 产品,先看它这套壳做得怎样,而不只是它用的哪个模型。

4 · 产品与护城河:模型即产品是暴言

「模型即产品」越来越像个暴言——前沿模型到用户之间,始终隔着一整套系统。一个只把模型直接暴露给用户的「产品」,几乎没有护城河:竞争对手可以换上同一个(甚至更好的)模型,你的差异瞬间归零。

真正的护城河在哪

护城河 = 系统层 + 数据 + 集成 + 工作流 + 分发,而不在权重本身。

给你选工具的方法

面对一个 AI 工具,多问三句:

答得越清楚,护城河越实在,工具也越值得信赖。

5 · 回到你的项目:用新语言复盘

K3 的开源许可证把业务分成两类,正好对应你做产品时的两种姿势:

复盘你做过的 agent 项目

结论:模型是商品、可互换;你的 harness 才是资产。

给你的 actionable

想一个你能把开源模型「嵌进去」的功能点(如本地摘要、分类、信息抽取),既降 token 成本、又避免数据出网——这就是「嵌入功能」思路的最小落地。

6 · 动手体验(可选)

推荐学习路径(由底到顶)

① 模型本体 ② 怎么跑起来(本地/云端/token/GPU) ③ 模型外的系统(harness) ④ 产品护城河 ⑤ 回到你的 agent 项目复盘
给你的建议:你做过 agent 项目,已经在 harness 层实操过(工具调用、上下文、重试、状态)。这篇文章是给你这套经验一个命名和系统框架。先建「概念地图」(本页)再啃细节,别一上来读论文 / 架构图。
📎 与本仓库另一本手册的关系:《AI 系统逻辑·学习手册》(ai-system-logic-guide.html)讲 「怎么跟模型对话 / 设计接口 / 用 Rubric 验收」(prompt / context 层思路);本页讲 「模型本身是什么、怎么跑、外面套什么」(模型层 + 系统层)。两本互补:一本管「你定义的输入输出结构」,一本管「你跑的是哪类模型、在哪跑、被什么系统包裹」。