用 Codex 撸了个"零接口"AI 微信客服:截图 OCR + 大模型 + 剪贴板,全程模拟真人
橙光Lab 这条 82 秒的视频,演示了一个他用 Codex 拼出来的 AI 微信客服:双手离开鼠标键盘,工具自己读消息、自己想回复、自己粘贴发出去,回复还”没有 AI 味”。
更值得拆的不是”它能自动回消息”,而是它选的那条路——全程不碰微信后台、不走任何接口,纯靠”截图 + OCR + 剪贴板”模拟一个真人在操作电脑。这条思路决定了它的全部优点和全部软肋。
来源:抖音 @橙光Lab,视频 desc「codex做了个ai智能客服,回复效果及思路分享」。本文按”口播逐字稿 + 画面识别”双轨扒出,时长 82 秒。
数据卡(先看全貌)
| 项 | 内容 |
|---|---|
| 作者 | 橙光Lab(抖音) |
| 时长 | 82 秒 |
| 主题 | 用 Codex 自研的「微信风格回复助手」,自动回复微信消息 |
| 开发方式 | Codex(vibecoding,描述需求拼工具) |
| 技术栈 | 截图 OCR(智谱)+ 大模型(智谱 GLM)+ 系统剪贴板 + 窗口自动化 |
| 成本 | OCR 与大模型 API 都走智谱免费额度,近零成本 |
| 演示场景 | 风水/饰品类客服(出现回复”挂在门把手上可以招财哦”) |
| 两种模式 | 手动给候选 / 全托管自动发 |
| 后续 | 打磨功能,出制作教程放粉丝群 |
一句话定性
这是一个 「读屏-决策-动手」的 GUI 自动化客服:把大模型当大脑,把 OCR 当眼睛,把剪贴板和键鼠当手,让它像真人一样盯着聊天窗口收发消息。
它的命门只有一句话——不调微信接口,所以任何聊天软件都能套,但稳定性全押在”屏幕看得准、点得对”上。这正是它最聪明、也最脆弱的地方。
它到底做了个啥(30 秒看懂效果)
视频前 10 秒是效果暴击:作者双手离开键鼠,屏幕里微信对话框自己冒出回复,10 倍速演示一条接一条地接待客户。
关键不是”自动回”,是回得不像机器。作者特意放大对话,强调回复”没有那种 AI 味、人机感”——因为回复不是裸大模型自由发挥,而是被一套上传的话术库框住的(后面细说)。
可以设置 2 秒、6 秒的随机延迟,模拟真人”看到-思考-打字”的节奏,避免秒回穿帮。
完整工作流:一个 OCR 驱动的闭环
把双轨信息拼起来,整套系统是这么转的(这是全文最该抄走的一段):
- 截图 —— 定时对微信聊天窗口截图。
- OCR 识别 —— 调智谱 OCR,把图片里的聊天文字转成文本。
- 判断要不要回 —— 看对方有没有发新消息;如果最新一条是”自己”发的,就不回(防自循环,下文重点)。
- 生成回复 —— 把识别到的对话文本 + 预先上传的话术库,一起喂给智谱大模型。
- 给三条候选 —— 大模型产出 3 条候选回复。
- 选一条 —— 手动模式让人挑;全托管模式自动选”最合适”的那条。
- 粘贴发送 —— 把选中的回复写进系统剪贴板,自动粘贴进输入框、自动发送。
- 轮询续接 —— 发完继续 OCR 检查;有新消息就回到第 3 步,最新是自己发的就停。
整条链路里没有一个环节调用了微信的官方接口——它读的是”屏幕”,发的是”剪贴板”。这就是”不需要接入后台”的真正含义。
五个关键设计决策(为什么这么做)
光知道流程不够,真正的功力在这几个”为什么”上。
1. 不走接口,改”看屏幕 + 剪贴板”
微信没有给个人号开放自动收发消息的接口,正规对接基本走不通。作者干脆绕开接口这一层:用 OCR 读屏代替”收消息 API”,用剪贴板粘贴代替”发消息 API”。
代价是它变成了一个桌面前台工具——必须开着微信、占着屏幕。好处是这套思路换微信为任何 IM(QQ、抖音私信、电商客服后台)几乎照搬,因为它不依赖任何一家的接口。
2. “最新一条是自己发的就不回” = 防自循环
这是所有自动回复机器人最容易翻车的地方:自己发的消息被自己的 OCR 又读进去,触发再回一次,无限刷屏。
作者用一条朴素规则挡住——判断最新一条消息的归属,是自己发的就闭嘴。一句话的逻辑,决定机器人会不会精神失常。
3. 随机延迟,拟人不拟机
固定秒回是机器味最大的来源。2~6 秒随机延迟把节奏打散,让对方感觉”对面有个人在打字”,而不是接了个自动应答机。
4. 话术库 grounding,按住”AI 味”
回复质量不靠 prompt 玄学,靠把上传的话术库一起喂进去。大模型不是自由创作,而是在你给定的语料范围里挑话说——这是它”没有人机感”的根因,也是事实不跑偏的护栏。
5. 三候选 + 全托管,留人工口子
不是直接发一条,而是先出 3 条候选:手动模式人来挑(兜底把关),全托管模式自动选最合适的(解放双手)。一套代码覆盖”半自动审核”和”全自动接待”两种信任级别。
它怎么保证”回复不像 AI”
把视频里的线索收一下,“没有 AI 味”是三件事叠出来的,不是单点魔法:
- 语料受限 —— 话术库 grounding,回复落在真人写过的口吻里。
- 节奏拟人 —— 随机延迟,避免机械秒回。
- 候选择优 —— 三选一,过滤掉那种一眼假的”标准客服腔”。
可抄的判断:想让 LLM 回得像人,第一步永远是”喂它真人写的话”,而不是写更长的 system prompt。
成本:OCR 和大模型都白嫖智谱
作者反复强调一句:“刚才那个 OCR、那个智谱的 API,都是免费的,不用花钱。”
- OCR —— 智谱的图像识别能力,免费额度跑日常客服够用。
- 大模型 —— 智谱 GLM 系列也有免费额度。
对个人卖家、小店这意味着边际成本近乎为 0:一台开着微信的电脑,加几行 Codex 拼的胶水代码,就是一个 24 小时不要工资的客服。这也是这条思路对小商家最大的诱惑。
可复制骨架(照着搭)
把它抽象成一个能直接套的伪代码循环:
loop:
img = screenshot(微信聊天窗口)
text = 智谱OCR(img) # 眼睛:读屏
last = 解析最后一条消息(text)
if last.是自己发的: continue # 防自循环:最容易翻车的一步
if 没有新消息: sleep(轮询间隔); continue
候选 = 智谱GLM(对话上下文 = text,
话术库 = 上传的语料) # 大脑:grounding 生成
回复 = 选最合适(候选[0..2]) # 手动挑 or 全托管自动选
sleep(random(2s, 6s)) # 拟人:随机延迟
剪贴板.写入(回复) # 手:剪贴板代替发消息接口
粘贴并发送()
只要你的目标软件满足”能截图、能粘贴发送”,这个骨架几乎原样可用。难点不在 AI,在窗口定位、OCR 准确率、粘贴发送的稳定性这些”手眼协调”的工程细节。
我的判断:这套思路的边界与坑
拆完得说人话——它好用,但别神化。
它最适合的场景:个人 / 小店、单账号、消息量不大、回复话术相对固定(电商售前、风水饰品、知识付费咨询这类)。当天就能用 Codex 拼起来跑,零接口、近零成本,这是它无可替代的快。
它的天花板和风险,按严重度排:
- 要占前台 —— 它本质是个桌面机器人,得开着微信、亮着屏,一台机器基本只能盯一个号,规模化很差。
- OCR 是单点故障 —— 截图糊了、窗口被遮挡、对方发图片/表情包,识别就可能错或漏,回复跟着跑偏。
- 平台风控仍在 —— “不走接口”绕开的是对接门槛,绕不开行为风控。高频自动粘贴发送,频率压不住一样可能被判异常。这点视频里没提,是真要落地必须自己补的护栏。
- 复杂咨询会露馅 —— 话术库覆盖不到的问题,三候选也救不了,该转人工还得转人工。
另一条对照路线(顺手记一笔判断):要更贴近真实使用环境、隐蔽性更好,还有”驱动真机做端上自动化”的路子,稳定性和工程量都更重;而桌面 OCR 路线胜在零依赖、当天能跑。没有谁绝对更优,看你要的是”快”还是”稳”。
Codex 在这件事里的真正意义:过去要写一堆 OCR、剪贴板、窗口控制的胶水代码才能拼出这种”读屏-决策-动手”的小工具,现在用 Codex 描述需求就能拼出来——门槛塌方式下降,把”想个自动化点子”到”今天就有个能跑的工具”的距离压到了几个小时。 这才是这条视频底下最值得学的一层。
一句话总结
用大模型当脑、OCR 当眼、剪贴板当手,绕开接口、框住话术、防住自循环——一个当天就能用 Codex 拼出来、近零成本的”拟人”客服。快是真快,稳要自己补。
作者说接下来会出制作教程放粉丝群——真要复刻,重点别盯着”调哪个大模型”,盯着上面那几个工程坑(窗口定位、OCR、风控、防自循环)才是分水岭。