这几个开源项目,帮你省99%的token

admin 2026-08-03 04:56:28 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文介绍了10个GitHub上真实存在的开源项目,旨在帮助用户节省AIAPI调用中的Token费用。这些项目覆盖了从优化提示词、压缩上下文、去重传输到智能路由和记忆管理等全流程,如superpowers优化提示词可节省40%Token,Headroom压缩输入可减少60%以上,rtk通过去重节省90%重复内容。文章建议用户根据需求搭配使用,例如从Headroom和rtk开始,逐步添加其他工具,以显著降低API成本而不影响效果。 综合评分: 88 文章分类: 其他


cover_image

这几个开源项目,帮你省99%的token

原创

仙草里没有草噜丶 仙草里没有草噜丶

泷羽Sec

2026年7月29日 07:55 湖南

在小说阅读器读本章

去阅读

在上个月查看API账单的时候,可真是吃了一惊。Claude和GPT的调用费用光是就花费了八百多。绝大部分的钱都花费在了重复传送上下文、传送很多没用的废话上面。我积攒了大半年的节省Token的工具,今天挑选出10个在GitHub上真实存在、能够直接使用的项目。按照Star数从高到低来进行排列,涵盖了从编写提示词到部署网关的整个全流程,使用了这些项目之后,用完一个月能够省出来两顿火锅的钱。

1. superpowers

我将第一个装完之后心里面想着,之前所撰写的很多提示词通通都是没有用处的玩意儿。

当下存在一个极为火爆的Agent技能框架。有上百个经过社区打磨过的技能。很多技能通通都是经过精简过后的Markdown,没有多余的话语。我之前自己编写的代码审查提示词快到两千字,而它里边的版本才三百多字,并且效果还更为优良。不用每次都重复去写大段的系统提示词,也不用自己去思索怎么写提示词能够节省Token,直接去使用就行,平均能够节省40%的提示词Token 。

Claude Code、Cursor、Cline这类编辑器皆是能够予以支持的,一键便可以进行安装。这是那种安装了并不划算的基础工具,不只是节省了Token,而且能力还变得更为强大。

开源项目地址:https://github.com/obra/superpowers

2. Headroom

它是由Netflix工程师进行开源的。我使用它用了有三周。输入的Token平均减少了有60%多。最厉害的那一次,把六万多Token的调试日志给压缩到了五千,而且错误信息一点都没有丢失掉。

HeadroomDemo-Fast

它不会去做那种一刀切式的压缩处理。不同的内容会采用不同的算法来进行操作。对于JSON结构就按照其结构来进行压缩。代码方面就通过AST语法分析的方式来删除冗余的部分。而自然文章则是采用专门的小模型来进行压缩。最为厉害的是还能够对输出的Token进行压缩处理。自动让模型不要说废话,不要重复地粘贴已经给过的代码。输出Token的价格是输入的五倍。节省下这部分的开销才是真正厉害的地方所在。

压缩之后依然是可以进行还原的。模型要是有需要查看原文的时候随时都能够去调取的,不会出现信息丢失的情况。不需要去修改代码,用一行命令把Claude或者Codex给包装起来就能够进行使用,也还能够运行透明代理,什么样的工具都能够进行连接。并且还支持跨Agent共享记忆,在Claude里面看过的代码,切换到Codex的时候不用再重新传送一遍,这一点真的是特别棒。

开源项目地址:https://github.com/headroomlabs-ai/headroom

3. everything-claude

有相当数量的人在使用Claude的时候花了不明不白的冤枉钱财,并非是工具不好用,而是你不晓得应该如何去对它进行使用。

这个仓库包含着社区所有人所探寻出来的种种技巧。比如说如何去撰写提示词才能够让Claude少讲没用的话,长对话的时候如何清理上下文又不会丢失信息,还有如何运用引用去代替重复的内容。我以前常常遇到对话进行了十几轮之后,Claude就开始反复说一样的话,Token消耗得特别快。按照这里面的办法清理了一回上下文,同样的问题Token就少了一半。

这并非是什么极为高端、上档次的工具。这不过是一群人在经历许多踩坑的过程当中所总结出来的经验罢了。你看完之后就会发觉,之前起码有一半的Token是由于提示词写得欠佳而被白白浪费掉。同样的需求会撰写提示词的人用一千Token就能够搞定,而你或许得花费五千Token,而且效果还比不上人家。

开源项目地址:https://github.com/affaan-m/everything-claude

4. LiteLLM

我之前使用AI的时候最为突出的问题便是,完完全全不清晰钱究竟花到什么地方去了。到底哪一个请求使用了多少Token,哪一个模型在耗费钱财,哪一个请求失败了却还在重试扣费,全部都是一团混乱,压根梳理不出个眉目来。

image-20260728215850328

LiteLLM是当下较为成熟的开源LLM网关。我之所以使用它主要是由于算账算得清晰明白。每一个请求花费了多少钱、使用了多少Token、哪一个模型昂贵哪一个模型便宜,在面板之上能够明明白白地看到。它内部内置了语义缓存,相同的问题第二次问就直接返回缓存的结果,不用再花钱。还能够设置预算的上限,每一天最多花费多少钱,到了那个额度就自动停止,不会出现测试的时候写死循环一整晚烧掉好几百块的那种糟糕状况。

能够支持一百好几十家模型服务商。在更换模型的时候不需要去修改代码。哪家价格比较低廉就使用哪家。哪家要是出现了故障就自动切换到下一家,不会耽搁干活儿。不管是做产品还是自己使用都挺合适。当下大部分的AI创业公司内部都在运转着这个(东西)。

开源项目地址:https://github.com/BerriAI/litellm

5. rtk

这个工具的原理那真的是简单到不能再简单,但是它的效果,好得都让人感觉特别惊讶。

你自行来算这么一笔账哈。系统所给出的提示词有着两千Token,对话是有十轮的,仅仅提示词就传递了两万Token。工具的定义、之前给到的代码、AI之前所说的话,每一轮都得重新进行传递一遍。这些重复的内容有的时候能够占到上下文的七成,就好比花了十块钱,有七块钱传递的是完完全全一样的东西。

rtk的操作方式为:初次出现的内容进行正常的传输,给予一个简短的标记。在那之后再遇到相同内容就仅仅传输标记。完全不存在任何损失。几毫秒就能够处理完毕,不会增加延迟。刚才所说的两千Token的提示词,经过十轮对话之后才是2090Token,单单这一项就节省了90%。它能够当作代理来运行,不需要修改一行代码,所有的工具连接上去就自动产生效果。长对话越多节省得也就越多,几十轮对话能够节省八成以上。

开源项目地址:https://github.com/insertish/rtk

6. OmniRoute

对于个人用户而言,这可是一桩不错的事儿,有那么九十多家具备免费额度的模型服务商被整合到一块儿,加起来每个月有着16亿的免费Token,绝大多数人在日常使用的时候根本用不掉这些免费的Token 。

它会依据任务难度来自动挑选模型,写个简单的脚本运用免费的小模型,而碰到复杂架构的问题才会使用昂贵的大模型。它内置有双重压缩,在请求发送出去之前先进行一遍压缩。要是服务商挂掉,能够在毫秒级的时间内切换到下一个服务商,不会因为某一个API出现问题而耽误工作。通过Docker能够一键启动,把所有AI工具的API地址改成它的地址就可以。我有朋友接入之后,一个月的API费用从三百多降到了七块钱,免费的额度基本是够用的。

开源项目地址:https://github.com/diegosouzapw/OmniRoute

7. cognee

长对话真的是让人感觉非常头疼。一聊起来时间一长,上下文就变得越来越长。Token的消耗也就越来越快。到了后面那个AI还会把之前说过的内容给忘掉。

cognee-demo

cognee是用于进行Agent记忆的东西。它可以将你的文档、对话历史、资料自动构建成为知识图谱。在对话的时候,仅仅检索当前所需要的相关内容放入上下文当中,并不会每一次都把所有的历史记录全部都塞进去。它相较于普通RAG更为聪明的地方在于能够理解实体关系,对于多跳问题也能够进行回答,不会堆砌一堆不相关的文档块来凑数。

借助六行代码便可以接入进来。在开展客服机器人、个人助手、研究Agent相关工作的时候特别地实用。就算是聊上百轮上下文也不会出现问题,Token始终把控在合理的范畴之内,也不会出现聊着聊着把之前的事情给忘掉的情况。

开源项目地址:https://github.com/topoteretes/cognee

8. zvec

进行RAG操作的朋友们应该是明白的,有很多的Token被白白浪费掉是由于检索方面存在问题,检索的时候弄出来一大堆不相关的文档块,全部都塞到上下文里面去,钱花出去了不说还对回答的质量产生影响。

zvec是阿里所开源的嵌入式向量数据库。其和SQLite是一样的,不需要单独去启动服务,直接嵌入到程序当中来进行运行。它可以达成十亿向量毫秒级别的检索。它比FAISS要快上十倍,而且内存的占用量还比较小。它在混合检索方面做的很不错,一次查询就能够捞出最为相关的内容,不需要反复地多次去进行检索,也不会召回一大堆没有用处的内容。

对于那中小规模的RAG应用来讲,使用这玩意儿比去搭建Milvus、Pinecone这类重型数据库要惬意好多。它是零依赖的,借助着pip install就可以进行使用。部署起来是挺简单的,速度也是比较快的。它从根源之处减少无关的内容进入到上下文当中,既节省了Token还能够提高效果。

开源项目地址:https://github.com/alibaba/zvec

9. mem0

它跟 cognee 存在着相似的地方,它更为轻巧,比较适合快速地接入到个人应用之中。

Mem0 Banner

官方所进行的测试数据显示,它相较于OpenAI原生记忆而言,能够节省90%的Token。它会自动地从对话当中提取关键的信息以及用户的偏好,并且将其存储到记忆层之中。新的对话仅仅把相关的记忆打捞起来,而不需要每次都把之前几十轮的历史全部传送进去。它还会自动地对记忆进行更新处理,过时的信息会自动地被丢弃掉,不会出现前后相互矛盾的这种情况。

能够和LangChain、LlamaIndex很好地进行集成,仅用几行代码就可以接入进去。当用于当作个人助手、客服的时候,不管聊多长时间上下文都不会出现超出的情况,而且也不会伴随越聊费用越高。

开源项目地址:https://github.com/mem0ai/mem0

10. LLMLingua

最后这一个是微软研究院所开源的经典提示词压缩工具。它曾经发表过EMNLP、ACL这两个顶会的论文。它可是当下所有提示词压缩工具的老祖宗。虽然它的Star数量没有前面很多的多,但是它绝对是很可靠的。

LLMLingua 架构图

它的运作原理是比较简单的。采用一个小的模型来给每一个Token赋予重要性的分数。把很多不重要的Token给删掉,最多能够压缩到20倍。GPT – 4在拿到经过压缩后的提示词之后还可以完整地恢复所有的关键信息,准确率方面的损失不到3%。LongLLMLingua这个版本是专门用来解决长上下文中间出现遗忘问题的,在RAG场景之下仅仅使用1/4的Token,效果还可以提升21% 。

可以几行代码就进行集成,并且还接入了LangChain以及LlamaIndex。在开展RAG、长文档总结、会议记录处理等工作的时候特别好用,能够直接把长文档压缩到原本的1/5到1/10这么个程度。

开源项目地址:https://github.com/microsoft/LLMLingua

最后

这些个工具,并非是全部都得给安装上。你就依照自身的需求去进行搭配便好了,可别把它弄成太过繁杂的模样。

我当下的配置是比较简单的。基础方面的装备是superpowers,利用其中经过优化过的提示词然后接着Headroom来开启自动压缩,简单的日常情况就使用OmniRoute去蹭免费的额度。遇到复杂的任务就走LiteLLM然后接着自己的Key,长对话的时候开启rtk来进行去重复。做RAG的时候就使用zvec再加上LLMLingua来开展检索以及压缩。样的一套配置,上个月的API费用已经降低到一百多,效果那是一点都没有打折扣。

一开始进行游玩的时候,可以先把Headroom和rtk给安装上。这二者全都是零代码来进行接入的。一运行起来就能够看到节省了多少Token,这可是最为直观的情况。要是去做长对话助手的话,那就添加一个mem0或者cognee。要是去处理长文档的话,那就添加LLMLingua。然后再慢慢地把它们给添加上去就好。

节省下来的很多Token费用全都是货真价实的真金白银,可千万不要把那不明不白、白白浪费的钱交到很多人工智能公司的手里面。

服务器推荐

阿里云全场九折优惠:

https://link.aitq.net/RcgjvF

image-20260721194150454

阿里云2核2g 99计划 99元每年,续费同价

image-20260721193517630

腾讯云2H2G 99 每年:

https://link.aitq.net/mVGWtG

image-20260721194058767

薄荷云活动16H16G25M,100G存储99/月,海外服务器:

https://link.aitq.net/RYbx8O

往期推荐

2026 国内香港CN2低价云服务器推荐

AI中转站搭建教程,快快收藏

这不辱?白嫖大厂1.5亿 Token,附使用方法

红日靶场官网挂了,备用网盘分享

在云服务器、vps中安装kali,2026最新教程

团队搭建AI知识库,这20个开源项目就够了

十个热门 AI Agent 渗透测试工具推荐


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:泷羽Sec 仙草里没有草噜丶 仙草里没有草噜丶《这几个开源项目,帮你省99%的token》

深伪检测与虚假信息对抗 网络安全文章

深伪检测与虚假信息对抗

文章总结: 本文档系统梳理了深度伪造检测与虚假信息对抗领域的核心理论、检测方法、技术标准与前沿研究。内容涵盖人脸交换、音频、文本等多模态深伪检测技术,以及基于水
评论:0   参与:  0