← 返回教程目录

使用教程 第 6 页 · 共 9 页

整理资料

预检 → 生成 → 审核 → 双闸门:把一个文件夹变成知识库和记忆。

是什么

整理资料不是单纯的「导入文件」,而是一条把一个文件夹变成知识库 + 记忆的完整流水线:预检 → 组织方式 → 披露 → 生成 → 疑似重复 → 归位审核 → 双闸门。AI 负责解析、归位、提炼记忆候选,人负责在两道闸门处最终拍板——第一闸门写入知识库,第二闸门写入记忆,不过闸门什么都不落库。

它只扫描已登记的工作区文件夹,不会修改磁盘上的原文件;进度逐份保存,中途关页重开自动续跑。

怎么用

  1. 选择文件夹,开始扫描

    入口:设置页左栏「🧹 整理资料」(速办工作区菜单、知识库页、记忆页也有入口)。点选一个已登记的工作区文件夹,或「📂 选择其他文件夹…」登记新文件夹,再点「开始扫描」。页面明示:只扫描已登记工作区,不改磁盘原文件。

    整理资料第一步:选择要整理的文件夹,已登记工作区列表与开始扫描按钮
    ① 选择已登记工作区文件夹(或登记新文件夹),点「开始扫描」
  2. 看预检结果

    扫描只读本地、不调模型,很快给出预检:支持类型份数、默认排除份数、类型不支持份数,以及排除原因分组(可展开看样例文件)。确认后点「下一步:选组织方式」。

    预检结果卡:支持类型份数、默认排除、类型不支持统计
    ② 预检结果:支持 / 排除 / 不支持一目了然,老格式与超限会单独提示
  3. 选组织方式(三档)

    三档单选:「按来源」(系统预置:本单位材料 / 上级文件 / 下级上报 / 外部参考,默认)、「按我的文件夹顶层目录」、「我自己输入分类」(一行一个)。AI 按你选的框架归位,不自创新分类;选定后本身份沿用。

  4. 生成前披露

    开始花模型份额之前,披露卡把账算给你看:将处理份数、所用文本模型与 Embedding 模型、向 LLM / Embedding 各发送什么、两段闸门各自的预估调用次数。确认无误再点「确认,开始生成」。

    生成前披露卡:份数、模型、各闸门预估调用次数
    ③ 生成前披露:份数、模型、各闸门预估调用次数,先看清再开始
  5. 生成:实时计数,可暂停、关页续跑

    生成阶段逐份跑解析 → AI 归位 → 向量化,实时计数(已解析 / 已归位 / 已向量化 / 失败 / 总数)加进度条。可随时「暂停 / 继续生成」、「重试失败项」;进度逐份保存,关页重开自动续跑。

  6. 疑似重复处理

    同内容副本按组列出,每组三选一:「合并为一份(推荐)/ 分别保留 / 只留其一」。「分别保留」不额外花模型份额,向量只算一次。

  7. 归位审核 → 第一闸门写知识库

    按目录分组核对 AI 的归位结果:目录级可批量改分类,低置信、拿不准的例外逐份列出,可改分类或排除。核对完点底部「确认归位,写入知识库」——这就是第一闸门,点了才真正写入知识库。

    归位审核:按目录分组核对,底部确认归位写入知识库
    ④ 归位审核:逐组核对、改例外,底部「确认归位,写入知识库」是第一闸门
  8. 记忆审阅 → 第二闸门写记忆

    接着进「记忆审阅(第二段)」:AI 从本批材料综合出的记忆候选按四簿列出——✍️ 笔法本 / 🧭 脉络本 / 📊 数据本 / 📖 术语本,逐条勾选、就地改、可自写补充。点停靠条「确认写入记忆」——这就是第二闸门;也可「本次不做记忆综合」直接收官。

    记忆审阅:笔法、脉络、数据、术语四簿逐条勾选改补
    ⑤ 记忆审阅:四簿逐条勾选改补,「确认写入记忆」是第二闸门

使用技巧

  • 整错了不必手工删:完成卡上的「↩️ 撤销本批入库」会先列出影响范围(移除知识文档数、按簿分列的记忆条数),确认后级联撤销;你手动改过的条目默认保留,可勾选一并撤。
  • 断点续跑:进度逐份保存,随时可以关页面;重开会出「有一次未完成的整理」横幅,点「继续」接着跑,已经花过模型份额的不重跑。

常见问题

整理会改动我磁盘上的文件吗?

不会。整理只扫描已登记工作区内的文件并读取内容,不移动、不改写磁盘上的原文件;整理结果写进应用自己的知识库与记忆。

「确认,开始生成」为什么是灰的?

披露卡会先检查授权、文本模型与 Embedding 是否都完成真实验证,缺哪项按钮就置灰,并给出「模型与检索检查」链接。先去 设置 → 模型与检索 补齐(Embedding 未配是最常见原因),再回来开始。

老格式的 .dps / .ppt 文件怎么办?

这两种老格式不支持解析,预检会单独列出并给出指引:用 WPS 或 Office「另存为」成 .pptx,再重新扫描即可。