扫描件公式提取:先分区再逐条整理

更新于

扫描件公式提取面对的是一张页面图像,页眉、题干、示意图和公式可能紧挨在一起。直接把整页内容当作数学表达式处理,容易得到夹杂正文的长串结果。先看清版面,把每条公式与它的来源位置对应,再逐条整理,校对才有明确对象。

先画页面地图,再决定摘取范围

打开扫描页的完整预览,找到正文段落、独立公式、图注和页脚。用一张单独清单记录需要保留的条目,例如“第十二页左栏第二式”。此时不急着裁图,先确认是不是还有跨栏内容,或公式的条件延伸到了下一行。

对于教材中的例题,要同时记下题目和公式的关系。只保存一条式子的图像,之后可能不清楚它是定义、过程还是答案。来源信息可以保留在清单里,实际送去识别的区域则尽量围绕公式,减少无关字符干扰。

页面歪斜明显时,先在副本中调整阅读方向,再划区域。若边缘有黑带,不要直接把整侧裁掉,先看黑带是否覆盖了公式起点。原始扫描页始终保留,后续发现缺项时能回到完整页面检查,而不是只剩零散的小图。

切分围绕结构,别围绕固定格子

一条短式可以单独截取,包含大括号的分段表达式则要把所有分支一起保留。分母较高或上下限较长时,上下边界也要相应扩展。平均把页面切成几块,可能恰好把分数线与分母分开,反而制造新的缺失。

化学教室里老师展示分子模型

当正文和公式在同一行,先阅读整句话,区分普通说明、数学条件与单位。说明文字可以转写到文稿正文;公式内部确实需要保留的符号不能因为靠近文字就删掉。若边界很难划清,可先保留完整局部作为参照,再准备一张只含目标表达式的处理图。

每张处理图都应有对应的来源编号,完成一条再标记一条。对内容相近的连续公式尤其如此,它们可能只差一个下标,混淆来源后很难仅凭外观重新排序。裁图完成后快速复看整页,确认没有漏掉夹在段落中的短式。

Mathpix:定积分公式

提取完成后先去查混入物

本站图片识别接受 PNG、JPG、BMP,单图不超过 5MB,提交时要求登录和会员。扫描页需先准备为符合要求的公式区域图片,再进行识别。得到内容后,先看行首和行尾是否混入题号、页码或图注字符。

发现多余内容时,不要直接按“像文字”批量删除。对照原页确认其身份,再修正当前结果或重新框选。例如右侧括号数字可能是公式编号,也可能是式子本身的一个因子,必须结合版面判断,不能只凭数字位置决定。

清理混入物后,再数分式层数、检查上下标和括号。若结果漏了整行条件,应回看切分区域是否包含它。把图片准备问题和字符修订问题分开记录,下一页遇到相同版式时就知道该先调整哪一步。

多行公式沿基准线与编号位对齐

汇总时保留回到原页的线索

整理多页材料,可以在文档中按章节放置说明与公式,来源页码另作记录。本站文档工作区支持在正文中插入公式,双击后可以继续修改。排好后按清单逐条勾核,检查内容和顺序,而不是只看总共有多少条。

最后抽查页面边缘、图旁与段落中间的公式,这些位置比单独居中的大式子更容易遗漏。遇到原件模糊或遮挡的地方,应注明待核对并寻找清楚来源,不把识别结果当成缺损资料的补全依据。

延伸阅读

常见问题

扫描件公式提取要先把整页切成小块吗?
应先预览页面并确定公式的位置,再按完整表达式划分区域。分块不宜机械平均裁切,要保留分式、上下标和分段条件的完整边界。
扫描件公式提取时正文混进公式怎么办?
回到原页检查框选边界,把说明文字放入单独的整理记录。若正文与公式同处一行,需确认哪些字属于条件或单位,不能看到文字就全部删除。