扫描件财报经 OCR,常把数字读错——多一位、少一位、串了列。我们让 1.3B 小模型只负责逐字照抄,让确定性引擎按会计恒等式逐条核对,把人眼几乎翻不出的错,精确指回犯错的那一格。
四步走完,财报里每个数字都带着页码坐标和判定来源。AI 只负责搬,数学负责算——AI 经手的算术是 0 次。
MinerU OCR 把扫描件 PDF 解析成带页码、坐标的结构化文本。
1.3B 小模型大规模密集调用,每张表只逐字照抄,绝不算账。
确定性引擎按 23 条会计恒等式逐条核对,对不上当场标红。
代码够不着的跨页 / 宽表,直接看图读回、跨页拼装,再过勾稽才采信。
在 1000 份真实招股书 / 年报(300 份官方 + 700 份自建)上实测,分母取"源文档里实际存在的报表",不是凑出来的好看分母。
留出集抽取率 · 招股书 95.7% / 年报 93.9%
勾稽校验触达率 98.7% · 忠实回查命中 ≈87%
读:1.3B 小模型近零成本;算:纯代码、永远可复现。

对接企业财报审计、尽职调查、风控合规场景,或想了解这套"小模型读 + 确定性引擎审"的方案落地——都欢迎扫码加微信交流。