Kimi K3开放权重了:2.8万亿参数意味着什么?普通电脑能跑吗?小白一文看懂 Kimi K3开放权重了2.8万亿参数意味着什么普通电脑能跑吗小白一文看懂最近Kimi-K3 在大模型和开源社区里迅速走红。有人说它有2.8万亿参数有人说它一次能处理100万 token还有人看到 GitHub 和 Hugging Face 上已经放出了完整权重马上准备把模型下载到自己的电脑。但对计算机初学者来说真正重要的问题不是“这些数字够不够大”而是Kimi K3 到底是什么2.8T、104B、MoE和1M上下文分别是什么意思它真的完全开源了吗普通电脑能不能运行完整模型不懂大模型部署的小白应该怎样真正用起来本文不要求你有人工智能基础。我会尽量避开晦涩公式用生活中的例子把 Kimi K3 讲清楚并带你完成一次最简单的 Python API 调用。 专栏介绍《GitHub小白开源成长课》这是一个专门写给计算机初学者、大学新生和刚开始接触编程的人的实战专栏。在这里我们不会只看 GitHub 项目的 Star 数也不会看到一条安装命令就立刻复制运行。每篇文章都会带你一起读 README、看许可证、分辨代码仓库与模型仓库、判断电脑配置是否足够再选择真正适合自己的体验方式。专栏会持续分享 GitHub 基础知识、优质开源项目、AI 工具、Python 实践、Windows 环境踩坑以及从“会下载”走向“能读懂、能使用、能修改”的完整过程。如果你也曾面对满屏英文、参数和命令不知道从哪里开始欢迎订阅《GitHub小白开源成长课》。我们不追求一天学会所有技术而是每次真正弄懂并跑通一个项目。**资料说明**本文主要依据 Moonshot AI 官方技术博客、GitHub、Hugging Face、Kimi API 文档、Kimi K3 技术报告以及 vLLM/SGLang 部署文档整理信息核对时间为2026年7月29日。模型功能、价格和部署支持可能继续变化请以文末官方链接为准。一、如果你只想看结论先记住这六句话**Kimi K3 是 Moonshot AI 发布的原生多模态 MoE 智能体模型。**它不仅面向聊天还重点强化了编程、长任务、视觉理解和工具调用。2.8T 是总参数量104B 是每个 token 激活的参数量。“只激活一部分”能够减少计算但不等于只需下载 104B 的权重。**1M上下文表示最多可处理 1,048,576 个 token。**它能容纳很长的代码和文档但“放得下”不等于“每个细节都能百分之百记准”。**更严谨的说法是“开放权重”。**官方公开了完整权重、模型配置、技术报告和部分推理代码但并未公开可完整复现训练的全部数据与流水线。**普通电脑不适合部署完整 Kimi K3。**官方 Hugging Face 仓库约 1.56 TB主流部署方案需要多张数据中心级加速卡。**小白最合理的路线是先用网页或 App再尝试 Kimi Code最后学习 API。**除非你在有大型 GPU 集群的实验室或公司否则不建议从下载权重开始。二、Kimi K3到底是什么Kimi K3 是 Moonshot AI 在 2026 年 7 月发布的旗舰模型7 月 16 日首先上线 Kimi 产品、Kimi Code 和 API7 月 27 日进一步公开完整模型权重和技术报告。根据官方资料它采用 **MoEMixture of Experts混合专家**架构拥有约2.8万亿总参数每个 token 激活约1040亿参数并支持最长1,048,576 token的上下文。官方将它定位为一个“原生多模态智能体模型”。这句话可以拆成三部分理解1. 大语言模型它能够理解和生成文字完成问答、总结、翻译、写作、推理和编程等任务。2. 原生多模态它不只读取文字还能结合图片进行理解在 Kimi 官方云端产品和 API 中还提供了视频输入能力。这里要特别区分**模型的云端能力不等于所有本地推理框架已经支持相同功能。**截至本文核对日期SGLang 的 K3 自部署方案只支持图片输入会拒绝视频和音频输入。3. 智能体Agent普通聊天模型主要负责“回答”智能体还会尝试“做事”。例如阅读一个大型 GitHub 项目搜索文件并分析源码调用终端和其他工具修改代码后运行测试根据运行结果继续排查问题整理文档、表格、网页或演示内容。所以Kimi K3 的重点不只是生成一段漂亮文字而是持续完成由多个步骤组成的任务。三、为什么Kimi K3会突然火起来原因1总参数量进入2.8T级别T是 trillion也就是万亿B是 billion也就是十亿。2.8T 2.8万亿参数 104B 1040亿参数2.8T 的规模让 Kimi K3 成为当前极少数达到“三万亿参数级别”且公开完整权重的模型之一。单看数字并不能证明模型一定更聪明但如此大的开放权重模型本身就具有很强的研究和工程价值。原因2MoE让“模型很大”与“每步计算”不再完全相等Kimi K3 一共有 896 个路由专家。处理每个 token 时系统会选择其中 16 个专家并让 2 个共享专家参与。你可以把它想成一家大型医院医院一共有很多不同科室患者到达后分诊台先判断问题每次只请最相关的少数专家会诊不需要让整家医院的所有医生同时处理一个问题。但这个比喻还有后半句虽然一次只请部分医生看病医院仍然要容纳所有科室。MoE减少的是每一步实际参与计算的参数不是让其他权重从硬盘和显存中消失。这正是很多初学者最容易误解的地方104B 激活参数不等于模型只有 104B也不等于普通电脑只需要加载 104B 权重。原因31M上下文适合长代码、长文档和长任务Kimi K3 的上下文上限是 1,048,576 token官方简称1M context。token 不是严格意义上的“字数”。英文单词可能被拆成一个或多个 token中文字符与标点也会按模型的分词规则转换。因此我们不能简单说“1M token 就等于100万汉字”。它的实际价值在于可以一次放入更多内容例如较大的代码仓库和多个源码文件一篇长论文及其补充材料大量会议记录或研究笔记很长的智能体操作轨迹多轮对话和工具调用结果。不过仍要记住**上下文长度是容量不是准确率保证。**就像书桌可以放下一百本书不代表读者能同时准确记住一百本书里的每一个数字。原因4重点能力正好落在“编程智能体”热门方向官方展示了 Kimi K3 在大型代码仓库、长时间软件工程、终端工具、前端视觉反馈、GPU 内核、编译器、科研计算、文档和办公任务中的案例。这与现在大模型的发展方向非常一致大家关注的已经不只是“模型会不会聊天”而是它能否在真实电脑环境中持续完成工作。原因5完整权重和技术报告已经公开Kimi K3 的模型说明位于 GitHub完整权重托管在 Hugging Face 和 ModelScope官方同时发布了技术报告。这让研究人员和基础设施团队可以研究其架构、推理与部署方案而不是只能通过聊天网页观察结果。四、再认识两个新名词KDA和AttnResKimi K3 不只是把参数数量放大还使用了两项关键结构。1. KDA让超长内容的处理更高效KDA 全称是Kimi Delta Attention。传统注意力在处理超长序列时计算和存储成本可能迅速增加。KDA 的目标之一是更高效地处理长序列信息。小白可以先把它理解成阅读一份超长资料时不再让每一页都用同样昂贵的方式与前面所有页面逐一比较。Kimi K3 的 93 层结构中包含 69 层 KDA 和 24 层 Gated MLA。我们不需要背下这些数字只需知道模型使用了混合注意力结构在效率与全局信息交互之间做平衡。2. AttnRes需要时能翻回更早的“笔记”AttnRes 全称是Attention Residuals。它让较后的网络层能够有选择地读取更早、不同深度的表示。可以把传统方式想成一份草稿一版接一版传下去而 AttnRes 更像是写到后面时不仅能看上一版草稿还能根据需要翻回更早的原始笔记。官方称 KDA、AttnRes、Stable LatentMoE 和训练方法共同让 K3 相对 K2 获得约2.5倍的总体 scaling efficiency。这里说的是缩放效率不能直接改写成“推理速度快2.5倍”或“模型能力提升2.5倍”。五、Kimi K3能力到底怎么样跑分应该怎样看官方模型卡公布了推理、代码、Agent、办公和视觉等多类评测结果。下面只列几个帮助大家认识测试方向的代表值测试Kimi K3官方结果大致考察内容GPQA Diamond93.5高难度科学推理DeepSWE67.5软件工程任务Terminal-Bench 2.188.3终端环境任务BrowseComp91.2浏览与信息查找OfficeQA Pro63.3办公知识工作Video-MME90.0视频理解看到跑分时不要立刻得出“全面碾压”的结论原因有三点这些数字主要来自 Moonshot AI 官方评测K3 的许多结果使用了reasoning_effortmax不同模型可能搭配不同的 Agent 工具或测试框架条件并非完全一致。更稳妥的结论是在 Moonshot 公布的评测套件中Kimi K3 在多项编程、智能体、办公和多模态任务上达到前沿水平但官方也明确承认它的整体体验与当时最强的闭源模型仍有差距。对普通用户而言最值得相信的评测不是一张排行榜而是用同一个真实任务、同一份资料和相同要求比较不同模型能否稳定完成。六、Kimi K3到底算不算“开源”这是讨论 Kimi K3 时最容易产生争议的问题。1. 官方已经开放了什么完整模型权重模型配置、处理器和部分推理实现GitHub 仓库与模型卡47页技术报告vLLM、SGLang 和 TokenSpeed 等部署入口自定义的 Kimi K3 License。2. 目前没有完整开放什么可逐项审计的全部原始训练数据从零复现预训练所需的完整训练代码与流水线所有训练配置和数据处理细节。因此严谨地说Kimi K3 更适合被称为开放权重模型open-weight model。可以用一个简单的比喻理解开放权重把训练好的“成品大脑”交给你 完整开源除了成品还把原料、配方和生产线都完整交给你这不是说开放权重“没有价值”。恰恰相反能公开一个约 1.56 TB 的完整前沿模型权重本身已经给研究和工程社区带来很大的探索空间。我们只是需要把概念说准确。七、普通电脑能运行完整Kimi K3吗先给结论不能实用地运行。官方 Hugging Face 仓库约1.56 TB包含 96 个权重分片。这只是模型文件规模还没有计算运行时、上下文缓存和其他系统开销。当前主流部署文档给出的硬件规模包括部署方案文档给出的配置示例vLLM最低建议 8×GB300生产流量需要多节点SGLang B3001个节点、8张卡SGLang B2002个节点、共16张卡SGLang H2002个节点、共16张卡SGLang H1004个节点、共32张卡Moonshot高吞吐建议64个或更多加速器的超节点配置因此普通笔记本不适合单张 RTX 4090 或 5090 不适合普通家用 NAS 不适合一台磁盘够大的电脑也不等于显存和计算能力足够社区的小尺寸蒸馏版或量化版不能自动等同于官方完整 K3 的能力。看到下面这种命令时vllm servemoonshotai/Kimi-K3不要误以为“复制一行命令就能在笔记本运行”。命令只是启动入口真正的门槛是巨大的权重、显存、跨卡通信、推理框架版本和长上下文缓存。八、计算机初学者应该怎样使用Kimi K3路线1先用Kimi网页或App体验这是成本最低、反馈最快的方式。建议不要只问“你是谁”“写一首诗”而是交给它一个与你学习真正相关的任务例如我是刚学Python的学生。请逐行解释下面这段代码 先告诉我程序的整体目标再解释每个变量 最后出一道只修改3行代码的小练习。或者请阅读我上传的论文。 先列出研究问题、数据、方法和结论 再区分“论文原文明确说明的内容”和“你的推测”。 所有关键结论都标注对应页码。先通过真实任务判断模型是否适合自己比先研究部署命令更有效。路线2用Kimi Code阅读自己的第一个GitHub项目Kimi Code 是 Moonshot AI 开放的终端编程智能体。它能够读取项目文件、搜索代码、调用终端并修改程序。对初学者来说第一个任务不要让它立刻“大改项目”而应该限制为只读分析请先只阅读这个项目不要修改任何文件也不要安装依赖。 请告诉我 1. 这个项目解决什么问题 2. 主要目录分别有什么作用 3. 程序的启动入口在哪里 4. 我应该先阅读哪三个文件 5. 运行项目前还需要确认哪些环境和配置。这样既能学习项目结构也能降低工具误操作的风险。官方 K3 仓库建议在 Kimi Code 中使用/model选择 K3具体安装方法请以 Kimi Code 官方 README 为准。**安全提醒**官方 Windows 安装方式会执行网络安装脚本。初学者不要从陌生博客复制同名脚本只使用官方仓库或官网链接更谨慎时可先打开脚本检查内容。路线3会一点Python后再调用官方APIAPI 可以理解为程序与模型之间的“服务窗口”。你的 Python 程序发送问题服务器返回模型结果。第1步准备环境和密钥官方示例要求 Python 3.9并使用 OpenAI Python SDK。你需要先在 Kimi API平台创建 API Key。截至 2026 年 7 月 29 日K3 API 需要账户至少成功充值 1 美元后解锁。规则和价格可能变化请以平台实时页面为准。安装依赖py-m pip install--upgradeopenai1.0在当前 PowerShell 窗口临时设置环境变量$env:MOONSHOT_API_KEY替换成你自己的API Key请不要把真实 API Key 写进公开代码、博客截图或 GitHub 仓库。第2步编写最小示例新建demo_kimi_k3.pyimportosfromopenaiimportOpenAI clientOpenAI(api_keyos.environ[MOONSHOT_API_KEY],base_urlhttps://api.moonshot.ai/v1,)responseclient.chat.completions.create(modelkimi-k3,reasoning_effortlow,messages[{role:user,content:请用计算机小白能听懂的话解释GitHub中的Fork。,}],)print(response.choices[0].message.content)运行py demo_kimi_k3.py如果终端打印出模型回答就说明你的第一次 API 调用成功了。第3步理解reasoning_effortKimi K3 始终开启思考模式支持三个推理强度参数值适合场景特点low简单解释、分类、改写更快、更节省输出high编程、分析、较复杂推理速度和质量折中max困难数学、长任务、复杂Agent默认值思考可能更久、成本更高初学者第一次测试建议用low确认程序和密钥工作正常后再根据任务提高强度。第4步多轮对话不要只保存最终文字官方特别提醒在多轮对话或工具调用中应把 API 返回的完整 assistant 消息放回下一次请求不能只保留content。因为完整消息还可能包含reasoning_content和tool_calls。如果使用的第三方框架丢掉这些内容K3 的表现可能不稳定。初学阶段可以先做单轮调用掌握基本流程后再实现多轮和工具调用。路线4有大型计算集群再研究自部署自部署适合以下人群研究 MoE、长上下文或分布式推理的实验室拥有数据中心级 GPU 集群的公司开发 vLLM、SGLang、通信和推理基础设施的工程团队确实有数据合规、模型修改或大规模服务需求的组织。如果你只是想学 Python、看论文、读 GitHub 项目或者体验 AI 编程官方网页、Kimi Code 和 API 已经更合适。九、最后总结Kimi K3 值得关注不只是因为“2.8万亿参数”这个醒目的数字而是因为它把大规模 MoE、1M 长上下文、原生多模态、编程和智能体能力结合在一起并公开了完整模型权重和技术报告。但对计算机初学者来说最重要的不是马上下载 1.56 TB 权重而是学会做出正确判断想了解模型先读官方README、模型卡和技术报告 想立刻体验使用Kimi网页或App 想学习AI编程尝试Kimi Code并从只读分析开始 想把模型接入程序学习官方API 想自行部署先确认是否拥有多卡数据中心级硬件一个真正会使用 GitHub 的人不是看到热门项目就立刻 Clone而是能够看懂项目是什么、开放了什么、需要什么条件以及它是否适合自己。 关注专栏一起把热门项目真正用起来本文是《GitHub小白开源成长课》的 AI 开源模型篇。下一篇可以继续实战不用本地部署如何用 Python 调用 Kimi K3 API并做一个能阅读 GitHub README 的小工具。如果这篇文章帮你弄懂了 2.8T、MoE、1M 上下文和开放权重欢迎点赞、收藏并订阅专栏。后续我会继续挑选真正值得学习的 GitHub 项目亲自阅读、运行和记录踩坑过程。你不需要追完所有热点。每次真正读懂并用会一个项目就是在建立自己的技术能力。参考资料Moonshot AIKimi K3官方技术博客GitHubMoonshotAI/Kimi-K3官方仓库Hugging FaceKimi K3官方模型与完整权重arXivKimi K3技术报告Kimi APIKimi K3 QuickstartGitHubKimi Code官方仓库Kimi K3 License原文vLLMKimi K3部署方案SGLangKimi K3部署方案与输入限制Kimi K3大模型GitHub人工智能PythonAI编程开源模型计算机初学者