一句话:它在薅一个定价漏洞

最强的模型往往也最贵。当一个模型输入 10 美元、输出 50 美元每百万 token 的时候,很多个人开发者会含泪切回便宜模型。

但 GitHub 上有个 3200+ star 的小工具走了另一条路,介绍只有一句话,直白到离谱:“把 Claude Code 的上下文渲染成图片,降低 token 用量。”

它叫 pxpipe。第一眼像歪门邪道,试完账单真降了 59%~70%。

它薅的是这么一个漏洞:图片的 token 成本主要由像素尺寸决定,跟图里塞了多少字几乎无关。 一段大约 4.8 万字符的系统提示词,直接按文本喂进去要 2.5 万 token;把它排版渲染成一张 1573×1248 的图片,只需要约 2700 个 image token。字数没变,成本掉了一个数量级。

就像当年考试写小抄——把字写得密密麻麻,一张纸条塞下整本书的重点。现在有人把这套思路用在了大模型身上。

它怎么工作的

pxpipe 是一个本地代理

拦截你的 coding agent 发出的请求,在请求离开本机之前,把其中比较臃肿、只需要”读大意”的上下文重新排版成一张张紧凑的 PNG,再塞回请求里发给模型。模型读这些图,走的是它读屏幕截图时那条视觉通道。

说白了,它不是让模型”真正 OCR 文本”,而是利用模型本来就有的看图能力,把大段上下文伪装成截图喂进去。一台自动的微缩”打印机”。

用起来也简单:本机有 Node.js 18 以上,npx 直接拉起代理,再把 agent 的请求地址指到本地端口即可。免全局安装、免配 API Key,还带一个本地 dashboard 能实时看省了多少、每次转图的前后对比、以及一个紧急关闭开关。

一组真实编码任务的对照:文本版账单 42.21 美元、上下文窗口占用 96%;pxpipe 版账单 6.06 美元、占用只到七成出头。两版任务都照常完成,模型依然能从图片化的上下文里读出关键信息、完成多步推理和代码修改。

真正要记住的,是它的坑

聪明归聪明,这里有个比”有损压缩”更值得写进脑子的判断:

pxpipe 是有损压缩,而且它出错时是”静默”的。

作者自己压了一段包含 hex 字符串的上下文,模型读图后把其中 4 个字符看错了,还自信地编出了一个看似合理的结果——它不报错,直接给你一个错的答案

这才是真陷阱。不是它会错,是它错了你不知道。于是有了一条很清晰、值得背下来的边界:

可以图片化的(只需读大意): 系统提示词、工具文档、较早的历史记录、大型工具输出(测试日志、搜索结果、代码片段)。

必须保留文本的(错一个字符就出事): 精确 ID、commit hash、密钥、需要逐字复制的命令和配置、错误码、精确数字。

pxpipe 默认只对特定几个模型生效,其他模型按文本直通,也能一键关掉——这层保护是对的。但边界得你自己心里有数。

另外两点也别忽略:效果强依赖模型,某个模型友好不代表换一个还行,得重新验证;它作为本地代理会拦截你所有的 prompt,涉及公司机密或敏感数据的项目,务必先审计代码或在隔离环境里跑。

谁该用,以及一条更通用的启发

最适合用它的,是把 coding agent 当”读仓库→改代码→跑测试→修 bug→再跑下一轮”的长任务在用、上下文经常爆满、又对每分钱敏感的个人开发者。任务越长、上下文越膨胀,省下来的越明显。

但如果你的预算并不紧张,我更愿意你把它当成一个认知锚而不是省钱工具:

当你把任何图片当上下文喂给多模态模型时,图里的精确数字、编号、字符串,都可能被模型”静默看错”。

这条对做内容、做自动化的人同样成立——比如让模型读一张表格截图去算数、读一张题目图去做资料分析,一眼读出来的精确值都不能全信,得复核。

pxpipe 的走红,其实是当下 AI 用户心态的一个切片:模型越来越强,也越来越贵;我们既想用最好的,又不想破产,于是开始琢磨各种”薅羊毛”的野招——把上下文压成图片、让便宜模型干体力活、用缓存减少重复计算。这些招数不够优雅,甚至有点野,但这就是真实的生产环境:预算有限,需求无限,只能在夹缝里找最优解。

学它,学的不是这一个工具,是这种”在约束里抠效率”的思路。