KnowNote
EN中文
源代码

1.3.0GPL-3.0

KnowNote1.3.0 · GPL-3.0

读你的文档。信每一个回答。

一个本地优先的桌面工作台,用来阅读和追问你自己的资料。每个回答都带着它来自的片段, 检索在你的机器上完成 —— 不在别人的云里。

Windows x64 · macOS Apple Silicon · 未签名,首次启动一次提示

KnowNote 的窗口:左侧知识库列出已导入的文档及其片段数,中间的对话面板显示一个问题与结构化回答,右侧笔记面板保存正在写的笔记。
知识库、提问与笔记。真实应用,真实窗口。
  • 本地优先

    文档、笔记本和嵌入都留在你的机器上 —— 嵌入模型在应用内运行,所以检索离线可用。

  • 可追溯

    每个回答都保留它依据的原文片段,以及片段在文档中的位置。

  • 轻量

    下载、打开、开始阅读。不需要 Docker,不需要服务器,不需要账号。

可以核对的回答

示意 · 原文为虚构

引用只有在能落到某处时才有价值。指向标记,线索会回到回答背后的片段。

handbook.pdf 第 14 页

  1. 01检索质量是整个流程的属性,而不只是向量库的。一个从句子中间
  2. 02切开的片段,检索效果差,引用起来更糟,无论怎样调优排序这一步,
  3. 03都补不回切分所破坏的语义。而保留文档原有的边界,
  4. 04在导入时几乎不花什么成本。

回答

切分才是检索质量真正被决定的地方。从句子中间切开的片段既难检索也难引用,所以修复应该在导入时完成.

片段记录了它在抽取文本中的起止位置,所以引用指向的是片段,而不是整个文件。

提问变成知识

问题索引(示意)

一本笔记本先积累问题,再积累答案。打开一条,看到回答依据什么、背后的片段,以及你的结论。

检索质量为什么会下降?4 个来源 · 12 条引用

回答

因为片段的边界在检索开始之前就已经决定了。一个落在句子中间的切分,会同时误导检索和所有从它摘出来的引用。

来源

  • handbook.pdf
  • survey-2024.pdf
  • notes-week-3.docx
  • draft-methods.pdf

原文中的片段

cited span · 12 条引用指向这里
一个从句子中间切开的片段,检索效果差,引用起来更糟,调优排序这一步也补不回切分破坏的语义。

笔记

边界是导入时的决定,不是排序时的决定。

稠密检索,还是 BM25?6 个来源 · 18 条引用

回答

两份材料都支持:语义类查询用稠密检索更好,而查询中出现稀有词时 BM25 有竞争力。分歧主要来自语料本身。

来源

  • survey-2024.pdf
  • benchmark-notes.pdf
  • course-reader.pdf
  • slides-w7.pptx
  • blog-post.html
  • draft-methods.pdf

原文中的片段

cited span · 18 条引用指向这里
在域外划分上,混合打分补回了大部分差距,这说明稠密部分承载语义,稀疏部分承载稀有词。

笔记

在同一份语料上比较两者。两份语料不算比较。

注意力开销如何随序列长度增长?3 个来源 · 9 条引用

回答

在序列维度上是平方增长。这里每份材料都把它当作要绕开的约束,所以真正的工作是找什么东西替代完整的注意力矩阵。

来源

  • attention-paper.pdf
  • efficient-transformers.pdf
  • course-reader.pdf

原文中的片段

cited span · 9 条引用指向这里
注意力操作的开销随序列长度的平方增长,因此实际的天花板由内存而不是算力决定。

笔记

天花板是内存。这会改写整个效率方向的读法。

什么样的证据会让我改变看法?5 个来源 · 21 条引用

回答

在同一份语料上,稀疏基线追平混合方案;或者去掉稀有词查询后混合结果依然成立。这本笔记本里都没有。

来源

  • draft-methods.pdf
  • survey-2024.pdf
  • notes-week-3.docx
  • benchmark-notes.pdf
  • rebuttal.pdf

原文中的片段

cited span · 21 条引用指向这里
消融稀疏部分后,总体分数只差两个点,但按查询的细分结果没有报告。

笔记

总体分数会把这件事盖住。看到小的改动,就索要按查询的表格。

这些论文有哪些共同的方法?4 个来源 · 24 条引用

回答

四篇里有三篇共享同一个早期池化步骤,之后才分叉。第四篇结构上不同,所以它的数字不能直接比较。

来源

  • survey-2024.pdf
  • attention-paper.pdf
  • efficient-transformers.pdf
  • benchmark-notes.pdf

原文中的片段

cited span · 24 条引用指向这里
三篇都在任何打分之前先得到定宽表示,所以它们的差异在于之后做了什么,而不是输入如何被读取。

笔记

那个不一样的最值得单独读。

本模块为示意,内容为本页撰写。

从文档到笔记

流程
  1. 放入你的资料每种格式都有自己的解析器,页面和幻灯片结构得以保留。pdf · docx · pptx · http
  2. 提问用你自己的话。检索是多语言的。仅限你的笔记本
  3. 核对证据每个回答都指回它依据的片段。引用 → 片段
  4. 积累笔记你的结论就留在资料旁边。结构化 · 本地

配合你选择的模型

自带模型

没有内置的对话模型,也没有我们的账号。添加任何兼容 OpenAI、Anthropic 或 Google 的端点,或像 Ollama 这样的本地服务。凭据留在磁盘上;检索不需要模型。

  • OpenAI端点
  • Gemini端点
  • Claude端点
  • DeepSeek端点
  • Ollama本地服务
  • Any compatible端点
  • 内置本地嵌入模型随应用提供
model
multilingual-e5-small
revision
761b726d
dtype
q8
dims
384
唯一随应用提供的模型 · 只做检索,不做对话

公开构建

1.3.0 · GPL-3.0

仓库就是项目本身。下列数字直接读自仓库。

星标
1,101
复刻
147
待处理问题
25
许可证
GPL-3.0

每个 issue、pull request 和 release 都是公开的。 还没发布的部分写在下载页。

你的资料。你的问题。你的知识。

只有一个界面会向你索取东西 —— 一个模型连接。嵌入模型已经在这里了。