关联主题::
同级:: 2026-08-14_星期五
下一级::

上周五,也就是(2026.08.07日)我去司法局阅卷,工作人员告知可以五个工作日内提交书面答复。
于是我带着厚厚的卷宗回家了。
IMG_1135.jpeg

什么是阅卷?

《中华人民共和国行政复议法》(2023年9月1日修订,2024年1月1日起施行)
第四十七条 行政复议期间,申请人、第三人及其委托代理人可以按照规定查阅、复制被申请人提出的书面答复、作出行政行为的证据、依据和其他有关材料,除涉及国家秘密、商业秘密、个人隐私或者可能危及国家安全、公共安全、社会稳定的情形外,行政复议机构应当同意。

由于内容过多,我觉得如果只是翻看纸质文件,处理效率会很低,即使和AI交流也很难对齐上下文背景,可能会出现很多幻觉。

所以我的第一个思路就是先对所有的纸质内容进行扫描将它们变为电子档。

一、扫描纸质文档

  • 使用的工具是:【夸克APP】
    image.png
    夸克APP是我用过的最好用的扫描工具,特别适合用来扫描试卷等纸质文档。
    支持多页扫描,扫描的内容会出现右下角。
    扫描完成后可以点开右下角的图片进行查阅。

image.png
扫描后的内容,AI会自动处理,我一般选择「增强」或「去杂质」。处理的效果很高,我没有手动二次处理过。
更关键的是,处理完的内容可以发送到电脑。

我的处理思路是这样的——
一组内容,扫描到一起,然后统一命名,如「1-行政案件立案登记表」,点击完成后继续扫描。
整个一本档案扫描完毕以后,再点开电脑端的夸克扫描。

你就可以看到刚刚扫描的全部内容了,每个文件下载后都是一个压缩包,每个压缩包里点开都是图片。
比如,我刚刚扫描了「1-行政案件立案登记表」,我是一次性扫描了十页,点开这个压缩包后我看到的就是10页的内容。

  • 所有的压缩包下载到本地以后,我的需求是:
    1、将每个压缩包里的图片合并为一个PDF;
    2、将这些所有的PDF最后再合并为一个大的PDF。

这个操作,我直接交给了Workbuddy,使用DeepSeek V4 Flash大模型完成了,操作非常快的。
如果你要下载的压缩包数量太大,也可以交给AI去完成。
比如Codex、Workbuddy都可以操控你的浏览器。

Workbuddy是免费的国内Agent,地址: https://www.workbuddy.cn/events/invite?inviteCode=9od5w0tljqhnm

二、AI原子化处理

2.1 背景介绍及材料说明

先交代一下背景和需求——

举例说明理解

举个例子,

我作为受害人(被侵害人)向公安机关控告A违法,初步审查无误,A会被当作犯罪嫌疑人对待,会做笔录。
最终结案会给你决定文书(处罚or不予处罚)。
你对此决定不服就可以去行政复议,复议的部分是司法局,你是申请人,被申请人就是公安局,因为决定文书涉及到A,所以A就是第三人,行政复议的时候要带上第三人。
复议受理后,被申请人会在10个工作日提交书面答复、作出行政行为的证据、依据和其他有关材料,然后作为申请人就可以行使「阅卷权」去阅卷,复制带走卷宗。关联这个复盘:关于去司法局阅卷过程中的“焦虑”复盘

我收到卷宗的时候大致包含:

  • 第一组事实性证据:犯罪嫌疑人的笔录及身份证明;
  • 第一组事实性证据:被侵害人的笔录、证人的笔录、证据等;
  • 第二组程序类证据:诸如立案登记、告知书、传唤证、处罚文书、通案记录等等;
  • 第三组法律法规:作出决定的法规依据

第三人笔录-行政复议信息图.png

于是我手里就有了如下材料:

编号文件说明
1行政复议申请书向司法局进行行政复议的材料,我们提交的;
2行政复议答复书指的是复议机关受理后,要求被申请人做出的答复说明
3第一组事实类证据也就是“犯罪嫌疑人”(第三人)的笔录及身份证明
4第一组事实类证据(证人)侵害人的笔录,证人的笔录,其他证据材料等
5第二组程序类证据诸如立案登记、告知书、传唤证、处罚文书、通案记录等等
6第三组法律法规第三组法律法规:作出决定的法规依据
  • 下面具体解释一下

编号3:第一组事实类证据
image.png

  • 就是A的笔录。这个在案件侦办过程中,你是看不到的。
  • 这里有个疑问?作为申请人,阅卷是我们主动要求的,所以我们要去司法局阅卷然后带走档案。第三人是否可以阅卷?第三人阅卷的时候大概率不是司法局邮寄,应该也是要主动到司法局阅卷。(这方面困惑待核实)

编号4:第一组事实类证据(证人)
image.png

编号5、6:第二组程序类证据
image.png

2.2 文件建档设计思路

在第一部分我提到过,我已经使用夸克扫描王将所有的纸质文档变为了电子版,这样做的目的就是交给AI处理。
但是怎么处理呢

如果你只是把PDF扔给AI,AI的确会给你摘要,摘要虽然方便阅读。

但是无法将有价值的要点不遗漏的提炼出来,多轮对话以后,无法回答这句话究竟来⾃哪⼀份答复书?在第⼏⻚?是公安机关的主张,还是卷宗已经证明的事实?它对应哪份证据…

所以我才要设计一个系统。
这样做的根本目的是:在不丢失重要信息的前提下,把卷宗变成可核对、可比较、可检索、可用于维权决策的结构化档案。

  • [I] 这里我使用的工具是Codex,大模型是5.6 Luna 最高(量大便宜),主要是gpt 5.6具备多模态功能,也就是能看图。扫描后的内容,无论怎么处理都是需要OCR的,将图片转为文本。我这里没有用Workbuddy处理,后面我处理过一份聊天记录让Workbuddy识别,准确率不高。

想法是最宝贵的东西

起初,我只有一个模糊的想法,先对「行政复议答复书」进行处理,如果跑通闭环了,再让AI处理其他文档。
具体想法,对文档进行编码,对页数进行编码,对文档里提到的所有“要点”都要提炼出来

  • 目的有三个:
    1、我认为只有将一个文档拆解为具体的模块,而且是标准格式,才能方便AI处理和阅读。如果所有内容直接堆给AI的话,AI没办法一次性记住那么多东西,肯定会有遗漏或者出现幻觉。
    2、建立档案和编号的目的,就是要求提炼的所有内容都有事实依据,不是AI杜撰的,保障可靠。
    3、AI和人可以建立通识,你和AI都知道这个内容是什么?不会出现,你认为AI理解了,但是AI理解的是另一个东西的情况。

举例说明,180号案的答复书共计4也内容,对其编码就是:

  • R180-P02 :R代表Reply,表示“答复书来源”;180表示案号;P02代表第2页。

具体要提炼哪些内容,这个AI更擅长,让它去判断有哪些类型的内容。(⼈物、事件、问答、证据、法律依据、观点等)
具体提炼什么内容,以及如何编码,不需要记住,让AI写进设计文档里,我大体了解即可,如:

层次编号示例解决什么问题
文书R180知道信息来自哪一份答复书
页码R180-P01能回到具体页面
人物P-R180-01避免姓名重复、身份混淆
问答QA-R180-001保留一组完整的提问—回答关系
事件EVT-R180-001记录时间、地点、人物和行为
证据引用EVD-R180-001记录答复书提到的材料类型
原子论点CLM-R180-001记录一条可独立核对的陈述
论证节点ARG-R180-001记录被申请人论证金字塔中的分论点
缺口GAP-R180-001记录材料或论证链的缺失
待审核REV-R180-001记录需要你确认的内容

其中不得不提的事REV这个编码,也就是AI拿不准的,需要人工审核的内容。
每个审核项至少包含:

字段说明
审核编号REV-R180-007
类型OCR、身份、页码、证据、论证、矛盾、法律依据等
原文位置R180-P02,必要时附局部截图
当前读法AI 目前读到的内容
候选读法存在多种可能时全部列出
为什么不确定模糊、遮挡、缺页、前后不一致等
影响是否影响身份、期限、事实、证据链或下一步行动
人工决定留给你填写
状态待审核、已确认、已修改、保留异议、暂不处理
  • 默认规则是:不确定就保留候选,不用流畅的句子掩盖不确定性。
  • 这样设计就会最大程度把所有有价值的信息都保留下来,AI拿不准的也会单独提炼出来告诉你。

除此以外还有三点要求:

  1. 先登记事实,再写正⽂;
  2. 正⽂只是展示层,结构化注册表才是可校验层;
  3. 并⾏ Agent 可以提交候选材料,但最终合并要有单⼀⼊⼝。

为此,我是这样设计的。
我让AI产出三个东西:

原始扫描 PDF
└─ 证据源:只能保留,不能被摘要覆盖

Rxxx JSON
└─ 结构化主记录:供机器校验、检索、合并和回写

Rxxx Markdown
└─ ⼈⼯阅读版:供你快速理解、批注和审核

也就说:

  • 原始扫描件是“原⽂在哪⾥”;

  • JSON是“机器如何准确管理这份提炼”;

  • Markdown是“⼈如何阅读和审核”;

  • 总结一下吧,其实没那么复杂,就是告诉AI,原始PDF不方便阅读和处理,先让AI对PDF里的所有信息要点都提炼出来,自己对内容的类型进行分类,如人物、事件、身份信息、地点等都要提炼,每个类型都单独编号,所有拿不准的信息都要进行人工审核。产出1)Json文档,为每个部分建立档案;2)Markdown,也就是正文可以给人看的。先产出一个文档的结果,并给出设计方案,通过多次沟通迭代第一个文档的结果和设计方案的质量直到自己满意为止,然后再去处理同一批其他文档。

当前的方案和RAG向量检索还是有区别的。

2.3 并行处理和产出规范化

由于我是先处理的「行政复议答复书」,而且是先处理的其中一份答复书。
等这份答复书处理满意以后,其他的答复书我让Codex调用Agent并行处理。

这次,就是AI生成了四个Agent,你就理解为4个员工,每个员工处理几份文档,四个员工一会就把工作搞完了。

image.png

image.png

处理完当前对话的「行政复议答复书」,我还有好几组PDF要处理,比如「第一组事实类证据」、「第一组事实类证据(证人)」、「第二组程序类证据」…

这时候如果等着当前的对话处理完,再去处理其他文档是效率非常低的。

2.3.1 建立分支

Codex有一个功能是建立分支,可以从当前对话的节点建立分支,在新的对话里可以继承之前的所有对话。(上下文背景)
image.png

每个新对话话专门用来处理一类文档。
image.png

指令很简单的,就是把PDF所在文件夹拖拽进去,然后让AI处理这类内容,产出思路和答复书类似(因为已经继承了答复书的上下文,所以它知道该怎么搞)

image.png
这是我当时想出来的最高效的处理方案。

2.4 建立工作台

我在等待AI完成的同时,又建立了一个新的分支,用来研究官方的这几份文档的目录,是如何管理这个卷宗的。

官方分类要回答的问题
第一组事实类证据谁做了什么?事实是否真实?证据是否充分?
第二组程序类证据公安是否依次完成立案、通知、传唤、处罚、送达等程序?
第三组法律依据为什么适用这些法律条文?
总结论:行政行为合法
├── 事实清楚
│   ├── 谁到场?
│   ├── 谁实施了什么行为?
│   ├── 哪些人是亲眼看到,哪些只是听说?
│   └── 不同笔录是否相互一致?
├── 证据充分
│   ├── 每个行为是否都有具体证据?
│   ├── 证据是否真实存在于卷宗?
│   └── 证据与结论之间是否真的对应?
├── 程序合法
│   ├── 是否立案?
│   ├── 是否通知、询问、告知?
│   ├── 是否依法作出并送达决定?
│   └── 是否存在程序缺口?
└── 法律适用正确
    ├── 适用哪条法律?

    ├── 法律要求哪些构成要件?
    └── 案件事实是否逐项满足?

由于生成的资料太多了,我直接让Codex将这些资料结合起来给我生成一份html
image.png

其实AI给我生成的就是一个“工作台”,这个术语是我后来才知道的。

Workbuddy的专家里自带了一个工作台的专家,完成的应该是类似的事情。
image.png

Codex给我创建好的工作台大致是这样的:
image.png

这样我就具备了一个全局性视角,用这个工作台管理所有的文件,点击可跳转到具体的PDF等。

当时由于时间紧迫,我选择了一个很笨但是我认为是必要的办法,我将所有的PDF文档,都读了一遍,每读一个文档都会用滴答清单记录下我认为值得反驳的点。然后汇总进:2026.08.13阅读,由于实现没有约束Codex让它不要修改这个文档,导致有几次Codex对这个文档进行了修改,不过好在Obsidian有历史版本快照功能。

我认为这是必要的,你只有自己全部看一遍,才会对每个部分发生了什么事了然于胸。
至于前面建立的Json、工作台等也是为了和AI形成共识。

至于AI处理的这些资料,对每个部分进行的档案化,结构化处理,我认为肯定是大有用途的,等待后文探索。

这里有一个经验要分享,起初我是对着Codex生成的提炼内容开始阅读,后面我觉得还是有必要看一下PDF。
这里有一个功能,值得说一下,Codex生成的内容,在Codex里阅读的时候可以直接添加注释的。
image.png

对待某个部分有疑问可以添加注释,注释是会返回到对话里的,这样AI就知道你对哪个部分有疑问了。
Workbuddy也有这个功能。

三、终稿形成

整个过程,我其实有很多新的认识和疑问,这个后面单独梳理。
比如,“民间纠纷”如何界定?“寻衅滋事”如何界定?等等。

期间,我又处理了一份长聊天记录,这个聊天记录一开始让Workbuddy去处理,结果OCR识别效果很差。
后面我就让Codex开了一个新对话,让它创建Agent并行处理。

image.png

最终稿子,我是让Workbuddy使用DeepSeek V4 Pro完成的,主要是因为总感觉GPT 5.6写的内容太重了,不太合适(主观感受)。

此外还有一个原因就是,Workbuddy可以连接连接器,快速的对法律条文进行核查。

image.png

本期复盘主要是将整个的处理思路梳理一下,后面如果有其他要补充的地方,我再积极补充。