推文
@Zen_with_AI · 2026-10-10 01:26
最近和朋友聊天,有一个话题很有意思 -- 用LLM 得时候,打字有typo 会不会影响llm的效率和token的损耗。 我去看了几篇相关的论文,先说结论:typo 确实同时影响性能和 token 花费,但日常轻微 typo 可以忽略,严重的错字会影响较大。 性能:有论文实锤 MulTypo(Liu 等,arXiv:2510.09536):最接近真实打字场景,按键盘布局随机生成 typo。10% 字符损坏时,小模型掉 5–10%(Gemma Small −9.9%、OLMo −9.5%),大模型更抗造(−3~6%);推理类任务最脆弱,NLI 类几乎不受影响。 https://arxiv.org/abs/2510.09536 Gan 等,LLM 对抗 typo 的推理鲁棒性(arXiv:2411.05345,NUS/Google DeepMind):往坏里测,专门挑关键词改。Mistral-7B 在 GSM8K 上改 8 个字符准确率直接腰斩(43.7%→19.2%);但 GPT-4 级别只掉 2–3%,作者结论是这个量级的模型 typo 影响"可忽略"。 https://arxiv.org/abs/2411.05345 Brittlebench(2026,arXiv:2603.13285):typo 是影响最大的 prompt 扰动之一,性能随 typo 数量单调下降;连思维链都只能把损失从 2.79% 缓到 2.38%。 https://arxiv.org/html/2603.13285v1 Token 花费:机制确定,实测过 BPE 分词器靠高频字符串学合并规则,正确单词常是一个 token,拼错的词会被拆成更碎、更罕见的片段。实测(OpenAI tokenizer,cl100k_base):"receive"=1 token,"recieve"=2;一句话改 3 处 typo 后 token 数 +44%,字符数完全一样。 实用结论:偶尔的 "teh" 不用改;但大面积 garbling、关键词/数字拼错、OCR 转录糊成一团,影响推理和抽取任务,值得先清理。token 膨胀真实存在,但日常对话也就几十上百 token,差价不到很多钱;只有百万级噪声请求量的 pipeline 才需要在意。
曝光 1247 · 评论 2 · 点赞 10 · 书签 5 · 曝光/时 110.83915702693383