文章总结: 本文介绍了一个基于多模态大模型的本地OCR图片文字识别项目。该项目托管于腾讯CNB平台,利用硅基流动等平台的视觉模型API实现文字提取,支持截图粘贴、手机拍照及历史记录查询,测试成本极低。作者提供了一键部署提示词,用户只需准备相应的APIKey即可快速在本地搭建并使用该服务。 综合评分: 55 文章分类: 软文广告,产品介绍
本地搭建 OCR 图片文字识别服务
原创
hyang0 hyang0
生有可恋
2026年7月28日 05:56 湖北
在小说阅读器读本章
去阅读
腾讯出了一个类似Github的代码托管仓库,叫做 CNB,就是云原生build的缩写。我准备将日常用AI写的一些小工具推送上去。
地址:https://cnb.cool/hyang0
刚上传了一个图片文字识别(OCR)的项目,使用如下提示词可以一键部署到本地:
帮我把代码部署到当前目录 https://cnb.cool/hyang0/web-ocr 硅基流动的key放在目录下的 key.txt
使用硅基流动的视觉模型做OCR,需要提供硅基流动的Key,也可以换成其他平台的 API 和 key。
程序界面如下:
截图后可以ctrl+v,贴进去识别,支持历史记录。
支持手机访问,可以调手机摄像头。
关于 API 调用费用,我测试了10次,费用是¥0.016,10次不到两分钱。
多次识别的记录会留在下面,可以加载之前的识别结果,不用重复识别。
使用的模型是 Qwen3-VL-32B-Instruct,理论上现在的多模态模型比如 kimi、minimax、doubao-seed 都支持。如果你买的有 coding plan 也可以接进去试试,不需要买硅基流动的 API 。
如果需要买硅基流动的 API ,可以试试我的邀请链接,注册就送16块钱。
https://cloud.siliconflow.cn/i/n6PPXPuJ
测试图片:
识别结果:
全文完。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:生有可恋 hyang0 hyang0《本地搭建 OCR 图片文字识别服务》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论