文章总结: 本文介绍通过监督微调将KimiK3推理能力迁移至Qwen3.5-4B的方法。作者用100条推理数据借助LoRA完成SFT,微调后模型思考风格明显趋近K3。模型最终打包至Ollama,一行命令即可本地部署。百条数据仅为演示,扩充数据量后效果更佳,该方案为低成本体验K3推理风格提供了可行路径。 综合评分: 66 文章分类: AI安全
我用这种方法,一句命令部署Kimi K3 到自己电脑!
原创
郭震AI 郭震AI
郭震AI
2026年7月28日 23:34 美国
在小说阅读器读本章
去阅读
你好, 我是郭震!
Kimi K3,很火!
就连我的导师,都主动和我聊这个模型,看来海外也是具有相当知名度。
尝试把Kimi K3的推理迁移到咱们自己的电脑,玩一下,感兴趣的可以看看这篇文章。
文章结构首先介绍K3,中间介绍微调过程,最后介绍本地使用方法,其实就一句命令,完全免费,只供个人使用。
1 Kimi K3
当我看到这个榜单,有点小惊讶的,智能体能力接近或竟然超越Fable 5 和 GPT-5.6 Sol:
比如在 AutomationBench、SpreadsheetBench 2 和 BrowseComp 三个真实 Agent 榜单上同时拿下第一。更狠的是,它还开源了:
作为开放模型,综合表现已经正面压过 GPT-5.6 Sol、Claude Fable 5 等顶级闭源模型。
有读者可能会问,K3这么强,为什么还要开放权重?
开放可以快速建立全球影响力,吸引开发者、云厂商和推理框架接入。
更关键的是,K3虽然开放了完整模型权重,但它有2.8万亿总参数、每个token激活1040亿参数,部署门槛极高,一般公司很难真正跑起来,所以开放权重并不会让官方API失去价值,反而能用生态和口碑进一步放大K3的商业价值。
2 微调教程
有朋友跟我反馈Kimi K3的算力,现在也不太容易使用上,比较紧缺。
我们自己电脑要想使用到它的能力,可以通过监督微调,迁移它的推理能力到更小的开源模型,比如Qwen3.5:4B这样的模型中。
本文我使用这种思路,监督微调出:Qwen3.5-4B-Kimi-K3
第一步,搜集数据,看下搜集的数据分布,一共覆盖5个领域:数学,代码,规划,数据分析,错误反思;难度分为3层,推理级别Low、High和Max:
训练数据长这样:
推理Token,长度分布从两位到四位数,最长有8200个Token:
两天4个小时搜集了100条数据,做SFT玩一下。有时间的可以搜集2K-4K数据,微调效果会更好。
如上所示数据分布,难度,推理级别布局还可以,这为后续监督微调(SFT)提供基础。
有了数据,第二步微调。使用的环境是 RTX 5090 的 Windows 电脑,PyTorch 2.11、CUDA 12.8:
训练栈使用 Unsloth、Transformers 5.5 和 TRL 0.24.0,通过 LoRA 微调 Qwen3.5-4B。
由于Win 缺少 causal-conv1d 等 CUDA 扩展,我切换到了 Transformers 官方 PyTorch 回退内核,虽然速度稍慢,但可以直接训练。
SFT 的学习方式是:每条样本把“问题”作为输入,把 <think>推理过程</think> + 最终答案 作为监督目标
训练时对回答部分的每个 token 计算交叉熵,逐个预测下一个 token,预测错了就通过反向传播更新 LoRA 参数。
如下训练过程快照:1 step 实际耗时 5.45 秒,峰值显存 26G:
这个快照,峰值显存能到31G,基本占满32G显存:
训练2个epoch,模仿Kimi已接近80%,八成像了:
平滑趋势整体下降,0.7下降到0.5,感兴趣的可以根据验证集,继续挑选出最好的checkpoint
接下来就可以愉快的使用了,如下加载微调后的大模型:
Set-Location "C:\Users\guozh\Documents\work\gzh\qwen35-4b-sft".\run_chat.cmd
先来个问候,如下所示,红框所示为Kimi K3的思考过程:
接下来问一个Python问题,看到这个思考过程,截图只是其中一小部分,分析的
再问一个稍难点的问题,重点看它的思考Token:
如下是Qwen3.5:4B原生的思考Token,都是同一个问题:
可以看到咱们随便demo的100条数据,经过微调后, 和原生的思考Token已经彻底不同。
并且我去比较看了下Kimi的思考Token,它确实喜欢以用户开头:
看到上面K3的三次回答,两次出现用户开头,模仿它的思考过程,还是有感觉。
3 本地部署
cmd中使用不是那么友好,所以直接接入到ollama中,使用UI界面也更好一些,如下所示,选择这个模型:
思考Token有K3的风格了,是比较规整的几段思考过程:
回答部分截图:
本地安装方法,我也给你找到最精简的方法,最后经过一顿折腾,就是这一行命令:
ollama pull guozhennianhua/qwen3.5-4b-kimi-k3
本文部署教程,完全免费,只供个人使用。
最后总结一下
大家都很喜爱Kimi K3,但是原装参数太大了,根本无法本地部署,所以使用微调方法迁移能力到本地可操作的Qwen3.5:4B模型中。
实测下来,模型的思考方式确实发生了变化,并且成功打包进Ollama,在普通电脑上就能直接使用。
当然,100条数据只是玩一玩,距离真正的能力迁移还有差距;如果扩充到2K-4K条高质量数据,效果会更值得期待。
全文1611字,18张图,如果你觉得对你有帮助,也欢迎给我一个三连击:点赞、转发和在看;如果可以,再帮我点一个⭐️。谢谢你看到这里,我们下篇再见。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:郭震AI 郭震AI 郭震AI《我用这种方法,一句命令部署Kimi K3 到自己电脑!》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论