我用这种方法,一句命令部署KimiK3到自己电脑!

admin 2026-08-04 06:21:49 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文介绍通过监督微调将KimiK3推理能力迁移至Qwen3.5-4B的方法。作者用100条推理数据借助LoRA完成SFT,微调后模型思考风格明显趋近K3。模型最终打包至Ollama,一行命令即可本地部署。百条数据仅为演示,扩充数据量后效果更佳,该方案为低成本体验K3推理风格提供了可行路径。 综合评分: 66 文章分类: AI安全


cover_image

我用这种方法,一句命令部署Kimi K3 到自己电脑!

原创

郭震AI 郭震AI

郭震AI

2026年7月28日 23:34 美国

在小说阅读器读本章

去阅读

你好, 我是郭震!

Kimi K3,很火!

就连我的导师,都主动和我聊这个模型,看来海外也是具有相当知名度。

尝试把Kimi K3的推理迁移到咱们自己的电脑,玩一下,感兴趣的可以看看这篇文章。

文章结构首先介绍K3,中间介绍微调过程,最后介绍本地使用方法,其实就一句命令,完全免费,只供个人使用。

1 Kimi K3

当我看到这个榜单,有点小惊讶的,智能体能力接近或竟然超越Fable 5 和 GPT-5.6 Sol:

比如在 AutomationBench、SpreadsheetBench 2 和 BrowseComp 三个真实 Agent 榜单上同时拿下第一。更狠的是,它还开源了:

作为开放模型,综合表现已经正面压过 GPT-5.6 Sol、Claude Fable 5 等顶级闭源模型。

有读者可能会问,K3这么强,为什么还要开放权重?

开放可以快速建立全球影响力,吸引开发者、云厂商和推理框架接入。

更关键的是,K3虽然开放了完整模型权重,但它有2.8万亿总参数、每个token激活1040亿参数,部署门槛极高,一般公司很难真正跑起来,所以开放权重并不会让官方API失去价值,反而能用生态和口碑进一步放大K3的商业价值。

2 微调教程

有朋友跟我反馈Kimi K3的算力,现在也不太容易使用上,比较紧缺。

我们自己电脑要想使用到它的能力,可以通过监督微调,迁移它的推理能力到更小的开源模型,比如Qwen3.5:4B这样的模型中。

本文我使用这种思路,监督微调出:Qwen3.5-4B-Kimi-K3

第一步,搜集数据,看下搜集的数据分布,一共覆盖5个领域:数学,代码,规划,数据分析,错误反思;难度分为3层,推理级别Low、High和Max:

训练数据长这样:

推理Token,长度分布从两位到四位数,最长有8200个Token:

两天4个小时搜集了100条数据,做SFT玩一下。有时间的可以搜集2K-4K数据,微调效果会更好。

如上所示数据分布,难度,推理级别布局还可以,这为后续监督微调(SFT)提供基础。

有了数据,第二步微调。使用的环境是 RTX 5090 的 Windows 电脑,PyTorch 2.11、CUDA 12.8:

训练栈使用 Unsloth、Transformers 5.5 和 TRL 0.24.0,通过 LoRA 微调 Qwen3.5-4B。

由于Win 缺少 causal-conv1d 等 CUDA 扩展,我切换到了 Transformers 官方 PyTorch 回退内核,虽然速度稍慢,但可以直接训练。

SFT 的学习方式是:每条样本把“问题”作为输入,把 <think>推理过程</think> + 最终答案 作为监督目标

训练时对回答部分的每个 token 计算交叉熵,逐个预测下一个 token,预测错了就通过反向传播更新 LoRA 参数。

如下训练过程快照:1 step 实际耗时 5.45 秒,峰值显存 26G:

这个快照,峰值显存能到31G,基本占满32G显存:

训练2个epoch,模仿Kimi已接近80%,八成像了:

平滑趋势整体下降,0.7下降到0.5,感兴趣的可以根据验证集,继续挑选出最好的checkpoint

接下来就可以愉快的使用了,如下加载微调后的大模型:

Set-Location&nbsp;"C:\Users\guozh\Documents\work\gzh\qwen35-4b-sft".\run_chat.cmd

先来个问候,如下所示,红框所示为Kimi K3的思考过程:

接下来问一个Python问题,看到这个思考过程,截图只是其中一小部分,分析的

再问一个稍难点的问题,重点看它的思考Token:

如下是Qwen3.5:4B原生的思考Token,都是同一个问题:

可以看到咱们随便demo的100条数据,经过微调后, 和原生的思考Token已经彻底不同。

并且我去比较看了下Kimi的思考Token,它确实喜欢以用户开头:

看到上面K3的三次回答,两次出现用户开头,模仿它的思考过程,还是有感觉。

3 本地部署

cmd中使用不是那么友好,所以直接接入到ollama中,使用UI界面也更好一些,如下所示,选择这个模型:

思考Token有K3的风格了,是比较规整的几段思考过程:

回答部分截图:

本地安装方法,我也给你找到最精简的方法,最后经过一顿折腾,就是这一行命令:

ollama pull guozhennianhua/qwen3.5-4b-kimi-k3

本文部署教程,完全免费,只供个人使用。

最后总结一下

大家都很喜爱Kimi K3,但是原装参数太大了,根本无法本地部署,所以使用微调方法迁移能力到本地可操作的Qwen3.5:4B模型中。

实测下来,模型的思考方式确实发生了变化,并且成功打包进Ollama,在普通电脑上就能直接使用。

当然,100条数据只是玩一玩,距离真正的能力迁移还有差距;如果扩充到2K-4K条高质量数据,效果会更值得期待。

全文1611字,18张图,如果你觉得对你有帮助,也欢迎给我一个三连击:点赞、转发和在看;如果可以,再帮我点一个⭐️。谢谢你看到这里,我们下篇再见。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:郭震AI 郭震AI 郭震AI《我用这种方法,一句命令部署Kimi K3 到自己电脑!》

评论:0   参与:  0