TwKit

推文

@antiAIvo · 2026-10-10 22:12

最近在看@Karpathy的 LLM《Zero to Hero》 系列 看到有一期讲GPT Tokenizer的 以前觉得 tokenizer 很简单,就是把文本切成 token 结果一看竟然2个小时!肯定是我了学什么...... 教程开头就说: Tokenizer 是 LLM 里一个又必要又讨厌的环节 原因就是LLM 很多奇怪的行为和问题 其实都能追溯到 Tokenization 我学习的还是太浅了,竟然都没接触这些问题 感觉我要收回那句:“学习不需要看教程” 初级学习是不太需要 但是要深入学习,必须得看专业的教程 毕竟你没有科研经验,根本写不出这样的prompt喂给AI 这个教程大概讲了几件事: 1. Tokenizer 是怎么把字符串和 token 互相转换的 2. 为什么 Unicode、UTF-8 这些编码方式会影响tokenizer 的行为 3. BPE 算法是怎么训练的:数频率、合并、循环,一步步把 token 学出来 4. GPT-2 和 GPT-4 的 tokenizer 有什么区别,正则切分是怎么起作用的 5. 特殊 token 是干嘛的,为什么用不好会出问题 6. 最后回头解释:LLM 那些奇怪的毛病,有多少是 tokenizer 造成的 https://github.com/karpathy/minbpe

曝光 2559 · 评论 10 · 点赞 56 · 书签 46 · 曝光/时 281.6766364047065

TwKit
正在载入