EN
返回档案库

档案库 · 产品创意 · 技术决策 · 2024–2025

WordLlama将70B大模型的词嵌入回收为16MB CPU文字工具包

D. Lee Miller提取大模型的词嵌入码本,在不依赖上下文的情况下重新训练,并将相似度、去重和排序功能打包成一个仅需NumPy的16MB库。

D. Lee Miller (deepsquirrelnet)

创意是什么保留70B模型的词典,但不运行模型本身:将其词嵌入表提炼成一个极小的无上下文模型,用于CPU上的相似度、去重和排序。小步快跑

当时的题目

After years of working with LLMs, developer D. Lee Miller wanted a lightweight utility for preparing inputs, locating information and building evaluators — something pip-installable that runs on a CPU without PyTorch or any deep-learning runtime. Transformer embedding models were accurate but heavy; classic word vectors like GloVe were light but old.

它是怎么成立的

WordLlama源自一个简单的观察:语言模型的大部分词汇知识都存储在一个表格中。像Llama 3 70B这样的模型的词嵌入码本编码了其词汇的含义,而你不需要运行那700亿参数就能使用它。D. Lee Miller的库提取了那个码本,在不带上下文的情况下重新训练,并将结果发布为一个轻巧、快速、可pip安装的工具包。

训练配方保证了结果的可靠性。Miller将共享分词器的模型(如Llama 2 70B与Phi-3,去除特殊标记后)的嵌入码本拼接起来,添加了一个可学习的投影层,并训练了一个小的池化模型,采用多负样本排序损失加上俄罗斯套娃学习,以便可以截断维度来适应需求。训练结束后,网络和投影都被丢弃——整个词表保存为NumPy文件,推理时只需平均池化的词查找,因此运行时只需NumPy。

效果是尺寸和速度的优化:默认256维模型约16MB,最小64维、32k词表的模型为4MB,还有二值化版本,通过汉明距离比较。2024年9月的Show HN获得了370分和36条评论,项目自己的MTEB表格显示,WordLlama变体在所列任务上均优于GloVe-300d,同时仅用单个CPU核心运行——这是一种与Transformer模型不同的权衡,作者在帖子中清晰说明了这一点。

妙在哪

  • 词表是可重用的资产:对其进行提炼能让小任务继承更大模型的知识,而不必承担其计算开销。
  • 训练后丢弃网络使得推理变成查找:仅用NumPy、仅用CPU,无需PyTorch、无需GPU——这使得库可以随处pip安装。
  • 俄罗斯套娃训练意味着一个模型可以适应多种预算:维度可以从1024截断到64,无需重新训练。
  • 二值化嵌入将余弦相似度换成汉明距离,以略微牺牲精度换取更小的内存和更快的边缘端比较。

做出来什么

The Show HN of 15 September 2024 drew 370 points and 36 comments, with the author explaining the trick and comparing honestly with MiniLM in the thread. By September 2026 the repository had grown to roughly 1.4k stars, 48 forks and 323 commits, and the README's own MTEB table shows WordLlama ahead of GloVe-300d on every listed task while running on a single CPU core.

他们自己的页面WordLlama on GitHub

可以借走的

巨型模型充满了可重用的部分:其词表可以被提炼成小任务所需的轻量组件,并且免依赖的发布能极大扩展其影响范围。

后来

WordLlama在发布后持续演进:2024年10月引入语义文本分割,2025年1月支持Model2Vec静态嵌入,2025年2月支持可调用的类标准库排序及min/max工具。截至2026年9月,这个MIT许可的仓库已增长到约1.4k星标、48个fork和323次提交,其引用文件将该项目描述为“大型语言模型回收的词嵌入”,路线图指向DSPy评估器示例和检索增强生成流水线。

资料来源

发现哪里写错了?告诉我们。

轮到你了

你刚读完一个点子。把你手上的题目说出来,看看谁接过同样的题。

免费账号 · 3 次免费提问 · 不用绑卡

相关案例