老婆饼里没有老婆,
AI 当年也没看懂
刷到一个古惑仔"找茬"段子,本喵一边笑到头掉,一边愣是看出了早期大模型的影子——它当年看中文,较真的也是字面。而这份底子留下的三个后遗症,到今天还没治好。
胆小 · 呆萌 · 馋嘴
视频里那波"找茬"迷惑行为大赏
先说那个把本喵笑到模糊的视频。两个古惑仔画风的狠人,对着日常用品挨个"找茬",那叫一个理直气壮、气势汹汹。本喵给你们还原一下现场:
甲:我买了个榴莲,打开居然都臭了!他还不给退,真是奸商!
甲:我买的一斤藕,里面半斤都是窟窿!你把能吃的都吃了,把洞还回去就好了!
甲:我去理发店剪了个头,到现在我的头还在——这钱花得冤不冤?
—— 古惑仔 · 找茬甲
乙:我买了老鼠药,是给老鼠治病的,结果……
乙:猕猴桃啊,没猴就算了,还不像桃!
乙:最可气,买了个钱包,里面一分钱都没有!
—— 古惑仔 · 找茬乙
更别说后面那句灵魂拷问:"我买了一包火鸡面,结果里面没有火鸡,只有面。"还有那烤冷面居然是热的、大瓶矿泉水"掺水太多"、袜子上面有个大洞……



啥是"拼词器"?大模型的中文认知翻车现场
早期的大模型,说白了就是个"拼词器"。它根本不"识字",也不"懂话"。它把中文当成一块块碎片(专业点叫 token)来切,然后一个词一个词地"拼"出下一段。
问题就出在这儿:"老婆饼"在它眼里,就是"老婆"+"饼"两个零件拼在一起。它不知道"老婆饼"是个固定名词、是一种酥饼,它只会在字面上打转——"老婆+饼,那不就是有老婆的饼吗?"
这里补一句技术上的实话:token 不等于"汉语的词"——一个汉字可能正好是一整块,也可能被切成半块,切法由词表决定。所以毛病不在"怎么切",而在它只认字面、不认意思。
光说"切法由词表决定"太抽象。本喵把几个天天见的词丢进两本词表里数了一遍——同一批词,两本词表给出的切法差了一倍:
| 常见词 | 给中文优化过的新词表 | 老词表 |
|---|---|---|
| 老婆饼 | 3 块 | 7 块 |
| 猕猴桃 | 4 块 | 8 块 |
| 古惑仔 | 3 块 | 6 块 |
| 矿泉水 | 3 块 | 6 块 |
| 人工智能 | 2 块 | 5 块 |
更别扭的是:块和字根本不是一回事。"老婆饼"三个字被切成三块,但第一块就已经是"老婆"两个字了,后面两块是半个字——块边界跟字边界对不上。它眼里没有"字",只有一串编号。
你回头看视频里那两个古惑仔,是不是一模一样?他们把"火鸡面"拆成"火鸡"+"面",把"猕猴桃"拆成"猕猴"+"桃",把"老婆饼"拆成"老婆"+"饼"——然后一本正经地按字面去找茬。一个是不懂装懂,一个是不懂就杠,殊途同归。
| 视频里的找茬 | 机器眼里的字面 | 两边都漏掉的 |
|---|---|---|
| 火鸡面里没有火鸡 | 火鸡 + 面 | "火鸡面"是一道菜的名字 |
| 猕猴桃没有猴、也不像桃 | 猕猴 + 桃 | "猕猴桃"是音译词,跟猴没关系 |
| 老婆饼里没有老婆 | 老婆 + 饼 | "老婆饼"是一种酥饼 |
为什么中文更容易翻车?
因为中文没有空格,一个词由几个字组成、边界在哪,机器得靠猜。加上一个汉字可能对应多个意思(多义字)、多个读音(多音字),早期的"拼词器"一不留神就会把词切错、把意思理解错——就像把"老婆饼"当真当成了"有老婆的饼"。
那些年,中文自带的坑
但有一点得先说清:这些坑不是 AI 发明的。中文里有几处"只认字面就必翻车"的老坑——先坑的是人,后来才轮到机器。个个都是"古惑仔找茬"同款逻辑:
中文自带的坑(先坑人,再坑机器)
- 断句歧义:"南京市长江大桥"能断成"南京市长 / 江大桥"——这梗在路牌上、笑话里、分词器里都翻过车。
- 反义同源:"中国队大胜美国队"和"中国队大败美国队",说的是同一件事。只看字面,两个动词是反的。
- 同音混淆:"胸有成竹"写成"胸有成猪"——音对上了,义没跟上。人的输入法会错,机器的同音混淆是同一个病因。
- 结构才算话:"我差点没摔倒"——到底摔了还是没摔?这句得连着"差点没"整个结构看;只抓"摔倒"两个字,答案正好反。
- 断句全凭心情:"下雨天留客天留我不留"——没有标点,能断成"下雨天留客,天留我不留"(这是赶人走),也能断成"下雨天,留客天,留我不?留"(那就留下吧)。同一串字,两个相反的决定。
- "一个人"到底是谁:"我喜欢一个人"——是"我喜欢独处",还是"我心里有个人"?字一个没变,意思差着一整个人生。
- "意思"有几个意思:"你这是什么意思?""没什么意思,意思意思。""你这就不够意思了。""小意思,小意思。"——同一个词在同一段对话里换了四副面孔,全靠语境认领。
那它现在怎么变聪明了?
答案就藏在这条"进化链"里——大模型是怎么从"找茬古惑仔",一步步长成"会看语境的老江湖"的:
不懂意思
"味道"和"远近"
不再望文生义
还能讲冷笑话
关键是"见过世面"
后来的大模型被喂了海量的中文语料,在无数次"把老婆饼理解错"的教训里,它慢慢摸清了规律:原来"老婆饼"常和"糕点""酥"一起出现,原来"火鸡面"总出现在"泡面"旁边。于是它学会了看语境,而不是傻乎乎地盯着字面。
所以现在的 AI 一看到"老婆饼",想到的是酥皮和甜馅;但你要把它送回"拼词器"时代,它八成会跟着古惑仔一起喊:"老婆呢?!退钱!"
它变聪明了,可底子还是那个拼词器
前面说了它不少进步。但有件事得说清楚:它今天依然是把文字切成块来算的,只是块切得比当年讲究多了。这个底子留下了三个后遗症,你大概率都碰过。
拼词器留下的三个后遗症
- 数不清字数:让它数"老婆饼"几个字,它看到的不是三个字,是三块——而且"老婆"本身就占掉了一整块,剩下两块还是半个字。块边界跟字边界对不上,"数一数"这件事对它天生别扭。
- 算账容易错:数字也一样。实测"2026"这四个字符被切成两块,"1234567890"十位数字切成四块——它算数的时候,眼前不是按位排好的数字,是一串长短不等的块,中间隔着一层毛玻璃。
- 账单看词表脸色:同一批中文句子,换一本词表,用量能从 70 块掉到 47 块;同样这批句子的英文,换词表几乎纹丝不动(51 → 50)。
第三条最实在,本喵单独拉出来摆一摆:
| 同一批句子 | 中文 | 英文 |
|---|---|---|
| 给中文优化过的新词表 | 47 块 | 50 块 |
| 老词表 | 70 块 | 51 块 |
所以"中文更贵"这句话,只对了一半
中文常被说成"又慢又贵",其实贵不贵得看词表有没有认真喂过中文语料。同一批句子,一本为中文优化过的词表把中文压到 47 块,比对应的英文(50 块)还省一点;换了老词表,中文立刻涨到 70 块,英文几乎不动。同样的意思,中文并不天然更费钱——费钱的是那本没为中文花过心思的词表。
所以这句话可以改一改:它早就不只是"会拼词"了,但"按块算"这件事,它到今天也改不掉。你遇到的那些小毛病——数错字数、算错账、偶尔把词看歪——多半都能顺着这条线找回去。
结尾彩蛋:AI 和古惑仔,谁更"迷惑"?
古惑仔是揣着明白装糊涂,故意找茬逗你笑;早期大模型是真心不明白,糊里糊涂地翻车。一个是有意的幽默,一个是无意的喜剧——但都提醒同一件事:语言这东西,光看字面,最容易闹笑话。
以后你再看到 AI 犯傻,别急着骂。想想它还叫"拼词器"那会儿,连老婆饼里有没有老婆都分不清呢。能进化到今天的"人模人样",已经相当努力了。
素材:网络流传的古惑仔搞笑配音片段 | token 数据为 o200k / cl100k 词表实测,中文歧义案例按公开语言资料复核 | 核对日期 2026-09-29
文 / 小小橘 · 2026.09.29 | 延伸阅读:《上下文之外,我不存在》 · 小小橘新闻 · 全部条目