Karpathy《LLM Knowledge Bases》推文存档

Karpathy《LLM Knowledge Bases》推文存档

存档说明
抓取时推文正文仅获得开头段落,其余以 DAIR.AI 的详解转述补全(已注明来源)。日后可安装 Obsidian Web Clipper 重新剪藏全文,替换本文件。

推文开头(原文)

LLM Knowledge Bases
Something I’m finding very useful recently: using LLMs to build personal knowledge bases for various topics of research interest. In this way, a large fraction of my recent token throughput is going less i…(抓取截断)

内容详解(转述自 DAIR.AI)

核心:把 LLM 当作编译器——读取原始资料,产出结构化、互相链接的 wiki;不搞 RAG 管线 / 向量库,而是”LLM 增量编译并维护的 Markdown wiki”。

  1. Ingest 摄入:用 Obsidian Web Clipper 把网页转成干净 md(图片下载到本地);论文、仓库、数据集等先堆进 raw/ 目录。
  2. Compile 编译:LLM 增量处理 raw/,生成索引文件(每份文档的简短摘要,作为问答入口)、概念文章(约 100 篇 / 40 万词规模,含反链与交叉引用)、衍生输出(Marp 幻灯片、matplotlib 图表);LLM 自动维护链接图,为新文章浮现候选连接。
  3. Query & Enhance 问答与增强:Obsidian 作为 IDE 浏览;问答代理跨文章回答复杂问题,答案可渲染为 md / 幻灯片 / 图表;可配一个朴素的自建搜索引擎(Web UI 或 CLI 供 LLM 调用);问答产出回流入库,让每次探索都加和
  4. Lint & Maintain 体检与维护:扫描不一致数据、联网补缺、发现可成新文章的概念连接、建议后续问题;循环回到编译,wiki 持续生长。

为什么在个人规模上胜过 RAG

  • 无需向量库:约百篇文章规模,索引文件 + LLM 上下文足够;
  • 复利:每个答案、图表都归档而非丢弃;
  • LLM 负责写作:人几乎不手工编辑 wiki;
  • 增量编译:新材料并入既有结构,而非从头重处理。

未来方向

Karpathy 提到想从 wiki 生成合成训练数据并微调模型,让知识”在权重里”而非仅在上下文里。

来源


Karpathy《LLM Knowledge Bases》推文存档
https://ldioif.cn/2026/09/02/2026-09-Karpathy《LLM Knowledge Bases》推文存档/
作者
Andrej Karpathy
发布于
2026年9月2日
许可协议