Karpathy《LLM Knowledge Bases》推文存档
Karpathy《LLM Knowledge Bases》推文存档
- 作者:Andrej Karpathy(@karpathy)
- 发布:2026-04
- 原文:https://x.com/karpathy/status/2039805659525644595
- 完整版 idea file:https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f
存档说明
抓取时推文正文仅获得开头段落,其余以 DAIR.AI 的详解转述补全(已注明来源)。日后可安装 Obsidian Web Clipper 重新剪藏全文,替换本文件。
推文开头(原文)
LLM Knowledge Bases
Something I’m finding very useful recently: using LLMs to build personal knowledge bases for various topics of research interest. In this way, a large fraction of my recent token throughput is going less i…(抓取截断)
内容详解(转述自 DAIR.AI)
核心:把 LLM 当作编译器——读取原始资料,产出结构化、互相链接的 wiki;不搞 RAG 管线 / 向量库,而是”LLM 增量编译并维护的 Markdown wiki”。
- Ingest 摄入:用 Obsidian Web Clipper 把网页转成干净 md(图片下载到本地);论文、仓库、数据集等先堆进
raw/目录。 - Compile 编译:LLM 增量处理 raw/,生成索引文件(每份文档的简短摘要,作为问答入口)、概念文章(约 100 篇 / 40 万词规模,含反链与交叉引用)、衍生输出(Marp 幻灯片、matplotlib 图表);LLM 自动维护链接图,为新文章浮现候选连接。
- Query & Enhance 问答与增强:Obsidian 作为 IDE 浏览;问答代理跨文章回答复杂问题,答案可渲染为 md / 幻灯片 / 图表;可配一个朴素的自建搜索引擎(Web UI 或 CLI 供 LLM 调用);问答产出回流入库,让每次探索都加和。
- Lint & Maintain 体检与维护:扫描不一致数据、联网补缺、发现可成新文章的概念连接、建议后续问题;循环回到编译,wiki 持续生长。
为什么在个人规模上胜过 RAG
- 无需向量库:约百篇文章规模,索引文件 + LLM 上下文足够;
- 复利:每个答案、图表都归档而非丢弃;
- LLM 负责写作:人几乎不手工编辑 wiki;
- 增量编译:新材料并入既有结构,而非从头重处理。
未来方向
Karpathy 提到想从 wiki 生成合成训练数据并微调模型,让知识”在权重里”而非仅在上下文里。
来源
Karpathy《LLM Knowledge Bases》推文存档
https://ldioif.cn/2026/09/02/2026-09-Karpathy《LLM Knowledge Bases》推文存档/