橙光Lab 这条 82 秒的视频,演示了一个他用 Codex 拼出来的 AI 微信客服:双手离开鼠标键盘,工具自己读消息、自己想回复、自己粘贴发出去,回复还”没有 AI 味”。

更值得拆的不是”它能自动回消息”,而是它选的那条路——全程不碰微信后台、不走任何接口,纯靠”截图 + OCR + 剪贴板”模拟一个真人在操作电脑。这条思路决定了它的全部优点和全部软肋。

来源:抖音 @橙光Lab,视频 desc「codex做了个ai智能客服,回复效果及思路分享」。本文按”口播逐字稿 + 画面识别”双轨扒出,时长 82 秒。


数据卡(先看全貌)

内容
作者橙光Lab(抖音)
时长82 秒
主题用 Codex 自研的「微信风格回复助手」,自动回复微信消息
开发方式Codex(vibecoding,描述需求拼工具)
技术栈截图 OCR(智谱)+ 大模型(智谱 GLM)+ 系统剪贴板 + 窗口自动化
成本OCR 与大模型 API 都走智谱免费额度,近零成本
演示场景风水/饰品类客服(出现回复”挂在门把手上可以招财哦”)
两种模式手动给候选 / 全托管自动发
后续打磨功能,出制作教程放粉丝群

一句话定性

这是一个 「读屏-决策-动手」的 GUI 自动化客服:把大模型当大脑,把 OCR 当眼睛,把剪贴板和键鼠当手,让它像真人一样盯着聊天窗口收发消息。

它的命门只有一句话——不调微信接口,所以任何聊天软件都能套,但稳定性全押在”屏幕看得准、点得对”上。这正是它最聪明、也最脆弱的地方。


它到底做了个啥(30 秒看懂效果)

视频前 10 秒是效果暴击:作者双手离开键鼠,屏幕里微信对话框自己冒出回复,10 倍速演示一条接一条地接待客户。

关键不是”自动回”,是回得不像机器。作者特意放大对话,强调回复”没有那种 AI 味、人机感”——因为回复不是裸大模型自由发挥,而是被一套上传的话术库框住的(后面细说)。

可以设置 2 秒、6 秒的随机延迟,模拟真人”看到-思考-打字”的节奏,避免秒回穿帮。


完整工作流:一个 OCR 驱动的闭环

把双轨信息拼起来,整套系统是这么转的(这是全文最该抄走的一段):

  1. 截图 —— 定时对微信聊天窗口截图。
  2. OCR 识别 —— 调智谱 OCR,把图片里的聊天文字转成文本。
  3. 判断要不要回 —— 看对方有没有发新消息;如果最新一条是”自己”发的,就不回(防自循环,下文重点)。
  4. 生成回复 —— 把识别到的对话文本 + 预先上传的话术库,一起喂给智谱大模型。
  5. 给三条候选 —— 大模型产出 3 条候选回复。
  6. 选一条 —— 手动模式让人挑;全托管模式自动选”最合适”的那条
  7. 粘贴发送 —— 把选中的回复写进系统剪贴板,自动粘贴进输入框、自动发送。
  8. 轮询续接 —— 发完继续 OCR 检查;有新消息就回到第 3 步,最新是自己发的就停。

整条链路里没有一个环节调用了微信的官方接口——它读的是”屏幕”,发的是”剪贴板”。这就是”不需要接入后台”的真正含义。


五个关键设计决策(为什么这么做)

光知道流程不够,真正的功力在这几个”为什么”上。

1. 不走接口,改”看屏幕 + 剪贴板”

微信没有给个人号开放自动收发消息的接口,正规对接基本走不通。作者干脆绕开接口这一层:用 OCR 读屏代替”收消息 API”,用剪贴板粘贴代替”发消息 API”。

代价是它变成了一个桌面前台工具——必须开着微信、占着屏幕。好处是这套思路换微信为任何 IM(QQ、抖音私信、电商客服后台)几乎照搬,因为它不依赖任何一家的接口。

2. “最新一条是自己发的就不回” = 防自循环

这是所有自动回复机器人最容易翻车的地方:自己发的消息被自己的 OCR 又读进去,触发再回一次,无限刷屏。

作者用一条朴素规则挡住——判断最新一条消息的归属,是自己发的就闭嘴。一句话的逻辑,决定机器人会不会精神失常。

3. 随机延迟,拟人不拟机

固定秒回是机器味最大的来源。2~6 秒随机延迟把节奏打散,让对方感觉”对面有个人在打字”,而不是接了个自动应答机。

4. 话术库 grounding,按住”AI 味”

回复质量不靠 prompt 玄学,靠把上传的话术库一起喂进去。大模型不是自由创作,而是在你给定的语料范围里挑话说——这是它”没有人机感”的根因,也是事实不跑偏的护栏。

5. 三候选 + 全托管,留人工口子

不是直接发一条,而是先出 3 条候选:手动模式人来挑(兜底把关),全托管模式自动选最合适的(解放双手)。一套代码覆盖”半自动审核”和”全自动接待”两种信任级别。


它怎么保证”回复不像 AI”

把视频里的线索收一下,“没有 AI 味”是三件事叠出来的,不是单点魔法:

  • 语料受限 —— 话术库 grounding,回复落在真人写过的口吻里。
  • 节奏拟人 —— 随机延迟,避免机械秒回。
  • 候选择优 —— 三选一,过滤掉那种一眼假的”标准客服腔”。

可抄的判断:想让 LLM 回得像人,第一步永远是”喂它真人写的话”,而不是写更长的 system prompt。


成本:OCR 和大模型都白嫖智谱

作者反复强调一句:“刚才那个 OCR、那个智谱的 API,都是免费的,不用花钱。”

  • OCR —— 智谱的图像识别能力,免费额度跑日常客服够用。
  • 大模型 —— 智谱 GLM 系列也有免费额度。

对个人卖家、小店这意味着边际成本近乎为 0:一台开着微信的电脑,加几行 Codex 拼的胶水代码,就是一个 24 小时不要工资的客服。这也是这条思路对小商家最大的诱惑。


可复制骨架(照着搭)

把它抽象成一个能直接套的伪代码循环:

loop:
    img  = screenshot(微信聊天窗口)
    text = 智谱OCR(img)                     # 眼睛:读屏
    last = 解析最后一条消息(text)
    if last.是自己发的: continue            # 防自循环:最容易翻车的一步
    if 没有新消息:        sleep(轮询间隔); continue

    候选 = 智谱GLM(对话上下文 = text,
                  话术库 = 上传的语料)       # 大脑:grounding 生成
    回复 = 选最合适(候选[0..2])             # 手动挑 or 全托管自动选
    sleep(random(2s, 6s))                  # 拟人:随机延迟
    剪贴板.写入(回复)                       # 手:剪贴板代替发消息接口
    粘贴并发送()

只要你的目标软件满足”能截图、能粘贴发送”,这个骨架几乎原样可用。难点不在 AI,在窗口定位、OCR 准确率、粘贴发送的稳定性这些”手眼协调”的工程细节。


我的判断:这套思路的边界与坑

拆完得说人话——它好用,但别神化。

它最适合的场景:个人 / 小店、单账号、消息量不大、回复话术相对固定(电商售前、风水饰品、知识付费咨询这类)。当天就能用 Codex 拼起来跑,零接口、近零成本,这是它无可替代的快。

它的天花板和风险,按严重度排:

  1. 要占前台 —— 它本质是个桌面机器人,得开着微信、亮着屏,一台机器基本只能盯一个号,规模化很差。
  2. OCR 是单点故障 —— 截图糊了、窗口被遮挡、对方发图片/表情包,识别就可能错或漏,回复跟着跑偏。
  3. 平台风控仍在 —— “不走接口”绕开的是对接门槛,绕不开行为风控。高频自动粘贴发送,频率压不住一样可能被判异常。这点视频里没提,是真要落地必须自己补的护栏。
  4. 复杂咨询会露馅 —— 话术库覆盖不到的问题,三候选也救不了,该转人工还得转人工。

另一条对照路线(顺手记一笔判断):要更贴近真实使用环境、隐蔽性更好,还有”驱动真机做端上自动化”的路子,稳定性和工程量都更重;而桌面 OCR 路线胜在零依赖、当天能跑。没有谁绝对更优,看你要的是”快”还是”稳”。

Codex 在这件事里的真正意义:过去要写一堆 OCR、剪贴板、窗口控制的胶水代码才能拼出这种”读屏-决策-动手”的小工具,现在用 Codex 描述需求就能拼出来——门槛塌方式下降,把”想个自动化点子”到”今天就有个能跑的工具”的距离压到了几个小时。 这才是这条视频底下最值得学的一层。


一句话总结

用大模型当脑、OCR 当眼、剪贴板当手,绕开接口、框住话术、防住自循环——一个当天就能用 Codex 拼出来、近零成本的”拟人”客服。快是真快,稳要自己补。

作者说接下来会出制作教程放粉丝群——真要复刻,重点别盯着”调哪个大模型”,盯着上面那几个工程坑(窗口定位、OCR、风控、防自循环)才是分水岭。