之前我们介绍了 Knowhere 的纯视觉理解路线:VISION-MAP,它能够更好地识别图像类资料,而且能把原始页面留在系统里,让 Agent 需要时直接看页,每个结论都能回到证据上核对。
有读者好奇:一份几百页的文档,难道要让视觉模型从头翻到尾吗?
当然不是。
每问一次都通读全文,又慢又贵,还会把无关内容一起塞进上下文。VISION-MAP 真正要解决的,是在不把原始页面"抄没了"的前提下,先帮 Agent 找到最值得看的那几页。
今天我们就来讲讲 VISION-MAP 是怎么工作的,以及怎么使用它。
VISION-MAP 是怎么工作的?
第一步,保留源文件和页面标注。
文档进入 Knowhere 后,原始文件不会因为解析而被一份 Markdown 取代。每一页还会按原始样子存储,但其核心内容和图表资产已被理解和标准,页面里的文字、表格线、图片、印章和相对位置都在,为后面的回溯和审计留下了完整入口。注意,我们保留的是页面注释,不是把文件页面作为图片再存一次。
第二步,建立地图。
只有一堆页面还不够。一本几百页的文件,如果没有结构,Agent 还是只能从头翻到尾。
VISION-MAP 会按照文档的章节关系组织页面,形成“章—节—页面”的层级地图,并给页面配上必要的轻量说明。这些说明负责告诉 Agent“这页大概讲什么、属于哪里”,但不会取代原始页面。
第三步,先找路,再看页。
用户提出问题后,Agent 不需要把整份文件重新读一遍。它会先根据问题在章节地图里判断方向:哪些章节相关,是否还要往下钻,哪些页面值得收下。
找到候选页面后,再由视觉模型直接阅读原页,核对金额、条款、图表或版式关系,并把答案引用回具体页面。
这也延续了 Knowhere 一直以来的三步思路:先发现可能相关的内容,再沿着章节结构导航,最后交付可以追溯的证据。
VISION-MAP 适合什么场景?
VISION-MAP 不是什么场景都用得上。文档干净、答案就在一段话里的时候,直接读文字反而更快。它真正有用的地方,是那些答案没那么好找,还得留着让人复核的场景。尤其是处理高价值、强合规、高要求的文档时,VISION-MAP 最能发挥作用。
金融场景:答案和出处一样重要
如果分析师想知道:“某公司本季度经营现金流下降的主要原因是什么?”
只靠关键词搜,很容易翻出一堆带着“经营现金流”的段落——有的来自摘要,有的是现金流量表,有的是管理层讨论,甚至可能混进上一年的对比数据。单看每一条都不算错,拼在一起却说不清楚问题。
VISION-MAP 的做法是先翻到现金流量表,再去管理层讨论(MD&A)里找对应的说明,把数字、单位、口径、范围和解释依据都对上了再回答。给出的答案后面还跟着行项目、章节和页码,你想验证,随时可以点回去看。
对于投研、审计、风控等任务而言,“答案从哪里来”往往与答案本身同样重要。
工程场景:材料表、条款和图纸各说各的
再看工程、建筑和制造行业。
设计规范、招标文件、施工图集,随便一套就是几百上千页。想查一个材料的防火等级、一个构件的安装要求,翻起来才发现:等级在一张表里,要求写在另一章,具体位置还得看图纸。这些东西一旦被切成一段段的文本块,相互之间的关系就断了。
VISION-MAP 则会把相关的条款、表格和图纸页面一起找出来,让视觉模型对着页面核对。工程师和审查人员也能直接打开原页,看清楚表格里的数字、图纸上的标注,以及是不是最新版本。
归根结底,VISION-MAP 将 Agent 的文档问答从“给出一个概括性结论”,推进为“像人一样读懂文档,并拿出可核验依据的答案”,这也更符合专业人员当前逐页阅读、定位、复核和决策的真实工作习惯。它替代不了人的判断,但能省下不少来回翻资料、对版本的功夫,也能少一些断章取义和引错版本的麻烦。
为什么“能回到源页”这么重要?
因为合同审查、财务分析、工程核验这些事,出了错是要担责任的,不能一句“模型说的”就交差。
在这一点上,VISION-MAP 更像是给 Agent 配了一位懂行的文档审查员。它不会将文件简单切分为彼此割裂的文本 chunk,而是以接近人类阅读的方式,逐页理解文档中的标题层级、段落语义、表格、图像、图纸与版面结构,并建立“问题—证据—页面位置”的可追溯关联。
在用户提问后,系统不仅生成答案,还能基于对问题和文档结构的理解,准确定位答案来自哪一页、哪一个章节、哪张表格甚至哪一处字段;用户可一键跳转回原始证据进行核验。这种能力的核心价值不只是提升检索准确率,更是显著增强 Agent 检索与回答过程的透明度、可解释性和可审计性。
结果可以讨论,但证据得随时能打开——这就是 VISION-MAP 想保留的东西。
怎么在 Knowhere 里使用它?
现在,最简单的体验方式是直接打开我们的在线Knowhere Brain:https://notebook.knowhereto.ai/
当你上传一份文档时,可以根据文件特点选择合适的理解方式。
如果是排版清晰、以正文为主的电子文档,可以使用文本解析,让 Agent 快速搜索和引用段落。
如果是扫描文件、复杂报告、图纸、图文混排资料,或者你特别在意原始版式与数字细节,可以使用 VISION-MAP,让 Agent 沿着章节地图找到相关页面,再直接阅读原页。
实际使用中,你不需要操心底层到底调用了多少次模型。你只需要像平常一样提问,例如:
“帮我核对这一年的合同金额和付款条件。”
“这张图纸里设备 A 和管线 B 是什么关系?”
“这份报告的结论,和前面的图表是否一致?”
Knowhere 会根据文档和问题选择路径,把相关文字或页面交给 Agent。需要核验时,你可以从回答回到章节、具体页图,并追溯到最初上传的源文件。
文本轨负责高效地读,视觉轨负责完整地看。
这就是 Knowhere 的两条文档理解路线,也是我们做 VISION-MAP 的思路。
如果你正在处理扫描合同、复杂报告、工程图纸或任何“解析成文字以后总觉得少了点什么”的文件,欢迎来 Knowhere 体验 VISION-MAP,也欢迎把那些最难读、最容易出错的文件交给我们。
我们会继续把这双眼睛打磨得更好。