CGL Agent Lab

CGL AGENT LAB2026-09

会聊天的是 AI,
会拍板的是引擎。

这一页讲清楚我们最近在折腾的一套逻辑:怎么让 AI 不瞎猜、有记性、还不泄密。没有黑话,全部说人话。

一、先说问题:AI 有两个毛病

毛病 1:让它判断,它给你写作文

你问"这条客户消息急不急",它回你三段分析。你要的其实就一个词:急 / 不急。而且同一句话问三遍,答案可能不一样。

毛病 2:聊完就忘

昨天踩过的坑、你交代过的偏好,今天全部归零。每个对话都是失忆重启,好经验攒不下来。

我们的解法分两层:判断交给"决策引擎",记性交给"记忆系统"。下面分开讲,最后讲它俩怎么配合。

二、决策引擎:只拍板,不废话

决策引擎(国外叫 Jev,我们另部署了开源平替 Laya)是专门训练来"回答窄问题"的小模型。它不生成文章,只出三种答案:

🔸 是非题(noul):"客户是否明确要求退款?" → 是,把握 99%

🔹 选择题(choice):"这消息归谁处理?" → 账单组,把握 94%

🔺 打分题(score):"这预算有竞争力吗?" → 1.9 / 2,偏上

三个关键好处:

1️⃣ 不可能胡编——它只能从你给的选项里挑,结构上没法输出别的;
2️⃣ 自带把握度——它会说"我不确定"(置信度低),这时候机器自动转人工,不硬拍;
3️⃣ 便宜到可以放开用——一次判断约万分之二美元,一天调一万次也就几毛钱。

三、双引擎:一个在云上,一个在家里

我们装了两个引擎,各管一摊:

☁️ Jev(云端)🏠 Laya(本机)
擅长中文分类、打分,复杂语义是非判断,英文题
数据出网?会不会(纯本地)
花钱吗极少零
稳定性高同题问三遍,答案一模一样

写了一个统一入口:问题丢进来,它自动判断该给谁——涉及隐私的、要复现的,绝不出网;要精细分类的,交给云端。哪个引擎坏了自动切另一个,你无感。

例:一条客户消息进来
"是否含机密?"   → 🏠 Laya 本地判断(不过外网)
"归哪个部门?"   → ☁️ Jev 云端判断(分类更准)

四、记忆系统:让 AI 长记性

每个 Agent 配一本"工作日志"(journal),规则很简单:

📝 踩了坑、学了招、做错事,必须记一笔——场景是什么、下次怎么做,缺一样不许入库(防套话);
🛡️ 入库先过安检——本机引擎先扫一遍"有没有密码、有没有隐私",扫的时候日志内容不出网;
🔄 每周复盘——把散的观察合并成经验,写进"心智模型";该谁负责的事不乱记,以人定的规矩为准;
📉 会遗忘——没用的条目自动降权,不占地方。

一句话:日记本 + 安检门 + 周复盘 + 遗忘曲线。

五、融合:肌肉 + 记性,互相成全

这是最有意思的部分——引擎和记忆互相喂:

记忆喂引擎:带着先例去判断

引擎每次都是白纸,没有历史。把日志里"类似场景上次判了什么、后来结局如何"打包塞给它 → 判断从"凭感觉"变成"有先例"。原来没把握(39%)的判断,喂了 20 条历史后把握能上一个台阶。

引擎喂记忆:替日记本把关

新观察进来,引擎先判"是不是和最近 5 条重复"——重复的合并,不堆噪音;周复盘时判"这条经验还有没有用"——没用的进衰减区。日记本从"只进不出"变成"有新陈代谢"。

闭环:越用越准

每次判断的"谁答的、多快、多大把握"都记进日志。攒一个月,我们就知道哪个引擎在什么场景可靠 → 据此修订路由规则 → 判断更准 → 记录更可信。飞轮转起来。

但不越线:"什么值得记住"这种价值判断永远留给人(规则 + 人工复核),不交给机器自动裁。机器管效率和把关,人管方向和取舍。

六、实测数据(不是 PPT,都跑过)

测试结果
中文退款判断(是非)99.5% 把握,答对
工单分类(中文选择题)94~100% 把握,答对
同题问三遍答案完全一致(极差 0)
单次判断速度本地 0.2~0.3 秒 / 云端 0.8 秒
故障切换引擎挂了自动切备用,带标记可审计

测试环境:Mac 本地 + 云端 API,2026-09-29/30。中文选择题给本地 Laya 确实不行(把握 <50%),所以路由层硬性划给云端——知道自己不行也是能力。

七、一图总结

你丢进来的 问题 统一路由器 隐私的 → 本地 分类的 → 云端 🏠 本地引擎 不出网 · 0.3秒 · 答案恒定 ☁️ 云端引擎 中文分类更准 · 0.8秒 代码执行 把握不够 → 转人工 📔 记忆系统(工作日志) 历史判断与结局 · 周复盘 · 会遗忘 ① 每次判断记档 ② 检索历史先例 拼进下次判断 实线 = 判断流(左→右) 虚线 = 记忆闭环(①记档 → ②回喂)

一句话收尾:让 AI 写东西的是模型,让 AI 拍板的是引擎,让 AI 长记性的是记忆——三层各干各的,谁也别越位。

© 2026 CGL Agent Lab · 本页由 Hiro 构建 · 详细技术版见 /tech/