致知录
第 XXXIII 卷 · 第 01 篇 · gbrain · 1970.01.01

全景鸟瞰:gbrain 是什么、你能在里面得到什么

gbrain 工具拆解 · 1970.01.01 · 8 分钟阅读 · 2,085 字
目录 · 8
在钻进 14 课实现细节前,先建立一张地图——从一个使用者的所得,到架构师的设计取舍

后面 14 课会逐层拆 gbrain 的存储、检索、抽取、梦境、校准、透镜、权限、部署。在钻进细节前,值得先退一步看全景:一个人把知识交给 gbrain,到底换回了什么?而一个想造类似工具的人,又能从它的整体取舍里学到什么。读完全景再进各课,每课都知道自己正站在地图的哪一块。

本课是鸟瞰,不堆术语、不贴代码。所有论断来自 gbrain 官方 README 与架构文档,细节留待后续各课用源码实证。

一、它到底是什么:从一次普通检索的落差说起

普通搜索给你的是原始页面——「10 个提到你查询的片段」。gbrain 的定位恰恰卡在这个落差的切口上:它要给你的不是片段,而是答案。一句带引用的成文回答,外加一个诚实的声明——「大脑此刻还不知道什么」。

它最基本的形态是:你把知识写成 markdown 笔记,丢进一个 git 仓库;gbrain 把它们 ingest 进一个本地数据库;你的 agent 通过 MCP 接上它,检索、追问、综合。作者本人用它跑了 15 万页以上的个人与公司大脑,背后 66 个 cron 任务全天候运转——意味着这套东西不是 demo,是生产负载下磨出来的1

那么,一个人真正能从里面得到什么?可以从他跟系统的交互闭环来看。

二、一个使用者能得到的:输入—加工—输出闭环

喂进去的那一步,几乎零门槛。 笔记用普通 markdown 写,想关联哪篇就用 [名字](路径)[[名字]] 链一下。不需要学特殊格式,不需要预先建 schema。你手写,或者让 agent 自动抓取——会议、邮件、推文、语音、原创想法,都能进。

加工那一步对你完全无感,却正是价值所在。 gbrain 把 markdown 切块、做 embedding、建索引,同时自动织出一张知识图谱:每次写笔记都抽出实体引用,建立带类型的边——works_atinvested_infoundedadvisesattended 这类动词型关系,而且零 LLM 调用2。再往上是 24/7 的梦境周期:夜间自动整合记忆、修复引用、派生摘要。作者有句话很传神——agent 在他睡着时 ingest 和 enrich,醒来比睡下时更聪明3。对个人使用者来说,这意味着知识不是静态存档,而是会在你不在时自己长结实。

取出来的那一步,才是和普通搜索分道扬镳的地方。 检索不止关键词加向量,还能顺着图谱跳到相邻笔记。但真正让人体感不同的,是综合层:它不丢给你一堆片段,而是生成带引用的成文答案,并显式标出「大脑还不知道的部分」(gap analysis)[^readme-综合(synthesis)]。这改变了使用的姿态——你不是在翻档案,是在跟一个读过你全部笔记、且知道自己的盲区的助手对话。

闭环里有一条贯穿始终的心智:markdown 是唯一事实源,数据库只是缓存。你改了笔记、重新 ingest,一切都能重建。后面所有课的基石,都立在这句话上。

三、一个架构师能学到的:四个贯穿全局的取舍

若目标是造自己的工具,gbrain 最值得抄的不是某个函数,而是它反复押注的四个决策——后面每课都是它们的展开。

文件系统 canonical,markdown 是 system of record。 它不让数据库成为事实源,markdown 加 frontmatter 才是。好处是用 git 就能版本控制、diff、跨机同步、人工编辑、整体重建;代价是所有「数据库里的东西」都必须能从 markdown 重新生成。任何知识系统都该先回答「事实源在哪」,再让衍生结构可重建。

能用确定性提取的,绝不上 大模型(LLM)。 图谱用正则扫你写下的链接语法建立(零成本),而不是调 LLM 抽实体。LLM 只用在「用户没提供的信号」上——综合、判定、开放文本抽取。把昂贵的调用压在不可替代的环节,结构信号优先从用户已有的书写习惯里白嫖,这是成本可控的关键。

检索不押注单一范式。 关键词、向量、图谱遍历、LLM 综合叠在一起,且每个环节都能量化评测。改了检索逻辑,能用 eval 回归测量是变好还是变坏,而不是凭感觉。

机器负责发现,人负责决断。 矛盾探针只标出可疑、给修复命令,不替你删笔记;梦境周期的触发要你自己用 cron 或 autopilot 挂上,gbrain 不会偷偷自跑烧钱;存储分层让你自己决定谁进 git、谁只留库。控制权始终在用户手里——这是「AI 监督者」定位的精髓。

四、14 课地图:你正站在全景的哪一块

后面的课是上面全景的逐层展开:

主题对应全景的哪一块
01系统事实源(markdown 是 record)文件系统 canonical
02存储分层(db_tracked 与 db_only)谁进 git、谁只留库
03ingest 采集管道喂进去的那一步
04混合检索不押注单一范式
05图谱 + 矛盾探针确定性建图 + 质量自检
06schema packs(结构化抽取)加工的结构化
07围栏标记(fence) / 观点(takes) / 事实(facts)(观点与事实分层)记忆的结构化层级
08dream cycle 总览24/7 梦境周期
09dream cycle 作用域24/7 梦境周期
10think 校准机器发现、人决断
11透镜(lens) packs(投资者透镜)检索的视角切片
12访问控制公司脑的权限边界
13技能演化agent 能力随用随长
14部署与运维落地到你的硬件 / DB / key

五、两种读者的读法

想造工具的人,重点看每课的「为什么这么设计」——那是 gbrain 踩坑多年沉淀的取舍,代码细节可跳。单纯想用的人,重点看「你需要做什么、系统自动做什么、能力边界在哪」。最该警惕的错觉是「系统会不会偷偷替我做了什么」——答案贯穿各课:触发权和判断权,gbrain 都留给了你。

练习题

1

gbrain 里,什么才是唯一的事实源(system of record)?

2

gbrain 的知识图谱边(works_at / invested_in / founded 等类型)主要靠什么建立?

3

gbrain 的综合层(synthesis)和普通搜索的本质区别?

4

矛盾探针标出笔记里前后冲突的观点后,gbrain 会?

5

按 gbrain 的设计哲学,LLM 应该用在什么地方?


参考出处

Footnotes

  1. 代码仓库 README.md(「Search gives you raw pages. GBrain gives you the answer.」;作者用以跑 155,795 页个人/公司大脑,66 个 cron 全天候自动运行;约 15 分钟起一个个人 agent)。

  2. 代码仓库 README.md(「A self-wiring knowledge graph. Every page write extracts entity refs and creates typed edges (attended, works_at, invested_in, founded, advises) with zero LLM calls.」;BrainBench 上 P@5 49.1% / R@5 97.9%,关图变体 +31.4 P@5)。

  3. 代码仓库 README.md(「The 24/7 dream cycle is what keeps it sharp.」;agent 在主人睡着时 ingest 会议/邮件/推文/语音/原创想法,醒来比睡下时更聪明)。