I.
001 / 007
为虚构作品建立证据锚定的知识图谱
知识图谱里的每一句话,都能翻回它出处的那一页。
LoreGraph 把小说、戏剧、剧本、歌剧脚本变成一张可查询的图谱:人物、物件、事件、概念,以及它们之间的有类型关系。每条断言都带一个 evidence_span,点开任意一条关系就落到它出处的那一句。
85
部作品参考语料
11
种语言从源文到界面
08
轮抽取其中一轮是闸门
Israel Silvestre,1654
The Met, CC0
字面匹配 ≥ 95%
01切分
02抽取
03校验
04成卡
II.
002 / 007
规则
一张会悄悄编造关系的图谱,比没有图谱更糟。
多数从文本里抽知识图谱的工具,抽完三元组就让你相信它。对虚构作品来说这是致命的。LoreGraph 只守一条规则:每条抽取出的断言都带一个 evidence_span,也就是原文的字面子串;校验轮会丢弃字面匹配不到 95% 的断言。
模型只被允许使用
眼前这段文本。
它被明确告知:
忘掉你知道的
那个孙悟空。
眼前这段文本。
它被明确告知:
忘掉你知道的
那个孙悟空。
闭世界抽取:每条断言都能回到书里的一句话。
(Sphaera Mundi,1485。大都会艺术博物馆,CC0)
III.
003 / 007
LOREGRAPH 8-PASS PIPELINE
工程
对证据严格,对模型宽松。
读 Splink、ComEM 与 GraphRAG 定下了四件事:字面证据闸门、跨字符集可用的实体消解、按轮提交与幂等重跑,以及不绑定单一厂商的模型客户端。
V.
005 / 007
流程
八轮,从一段原文,到一条你可以亲自核对的断言。
+
第 1、4 轮是确定性的,第 2、3、5、6、8 轮调模型,第 7 轮是闸门而不是建议。每轮各自提交,失败的一次用 --from N 续跑,不会重复写入。
01
切分 →
确定性的章节感知切分,英文标题与「第N回」一样能识别。每个 chunk 都带一个全局故事时间位置。

02
抽取 →
抽有类型的提及,做实体消解(词面加向量 kNN 分块,再批量匹配)、共指、五类关系,以及它们隐含的常识事实。

03
校验 →
chain-of-verification。证据跨度对不上原文字面的断言在这里被丢掉,门槛是 95%。

04
成卡
每个实体合成一张 Hybrid Note:事实与推断分栏,每条推断标注置信度,并给出子类型与重要性层级。

文本里没有的,不进图谱。
github.com/YunyueLi/LoreGraph Apache-2.0
VI.
85 部作品,11 种语言
006 / 007
VII.
007 / 007
上手
三条命令,你手上那本书就有了一张图谱。
先 uv sync,对着装了 pgvector 的 Postgres 16+ 跑 alembic upgrade head,然后 loregraph ingest 加 loregraph extract。一把 OpenRouter key 就够。中等长度的长篇是分钟级而不是小时级,每本书还有 20 美元的预算上限,在轮次之间强制生效。
● Live
v0.1.0-dev / Apache-2.0
VII
LOREGRAPH APACHE-2.0






