无需登录 数据私有 本地保存

收据扫描与条目提取器 - OCR 识别并表格化

117
0
0
0

常见问题与解答

什么是OCR?收据扫描是如何工作的?

OCR(Optical Character Recognition,光学字符识别)是一种将图片中的文字转换为可编辑文本的技术。本工具使用Tesseract.js引擎,在您的浏览器本地运行OCR。

工作流程如下:首先,您上传收据照片;然后,工具对图片进行预处理(灰度化、对比度增强等);接着,OCR引擎逐行识别文字内容;最后,智能解析算法提取出商品名称、数量和价格等结构化数据。

整个过程完全在本地完成,不会上传您的收据数据到任何服务器。这是纯前端工具的核心优势,确保了您的财务数据隐私安全。

我的收据数据安全吗?是否会上传到服务器?

完全安全。本工具的所有操作都在您的浏览器本地执行:图片处理在Canvas中完成,OCR识别使用本地运行的Tesseract.js引擎,数据提取和表格生成也都在前端完成。

没有任何数据被发送到外部服务器。即使您关闭页面,也不会有任何数据残留。这是纯前端工具的核心优势之一。您上传的收据图片仅在当前页面会话中使用,不会被存储或传输。

我们无法访问您的任何数据,因为数据从未离开您的设备。这与许多需要上传图片到服务器的在线工具形成了鲜明对比。

如何提高OCR识别准确率?

提高识别准确率的关键在于图片质量和参数设置:

  • 光线充足:在明亮均匀的光线下拍摄收据,避免阴影和反光。
  • 平整放置:将收据展平,避免褶皱和弯曲。
  • 正面拍摄:尽量从正上方垂直拍摄,减少透视变形。
  • 高分辨率:使用较高分辨率拍摄,确保文字清晰可见。
  • 选择合适语言:在设置中选择与收据匹配的语言(中文/英文/混合)。
  • 尝试预处理选项:对于热敏纸收据(容易褪色),尝试"高对比度"预处理模式。

通常,清晰、平整、光线良好的收据照片能达到90%以上的识别准确率。

支持哪些收据格式和语言?

本工具支持识别中文和英文收据,包括混合语言的收据。常见的超市小票、餐厅账单、购物收据等热敏纸打印或电子收据截图均可识别。

支持的图片格式包括JPG、PNG、WebP。对于手写收据,识别准确率会有所下降,因为手写体的变异性较大。

工具内置智能解析器,能自动识别多种价格格式(如¥12.99、$5.50、12,99€等)和数量表达方式。无论货币符号在价格前面还是后面,都能正确处理。

识别结果不准确怎么办?可以手动修改吗?

当然可以!所有提取的条目都支持直接点击编辑。您可以修改商品名称、数量、单价和金额。也可以手动添加遗漏的条目或删除错误的条目。

表格底部会自动重新计算小计、税额和总计,确保数据一致性。如果OCR识别效果不理想,建议:

  • 调整图片预处理设置,尝试不同的预处理模式
  • 更换更清晰的图片后重新识别
  • 检查OCR语言设置是否正确
  • 手动修正识别错误的地方

记住,OCR只是辅助工具,最终的数据准确性需要人工验证。

如何导出提取的数据?

支持三种导出方式,满足不同使用场景需求:

  • 导出CSV文件:生成标准的CSV格式文件,可用Excel、WPS等电子表格软件打开编辑,适合后续数据分析和财务处理。
  • 复制表格数据:将表格内容复制到剪贴板,可直接粘贴到邮件、文档、即时通讯工具等应用程序中。
  • 打印:生成整洁的打印版本,包含完整的条目信息和汇总数据(小计、税额、总计),方便存档或提交。

导出数据包含所有条目及汇总信息,方便您进行记账、报销或数据分析。

OCR识别需要多长时间?

识别速度取决于图片大小、语言包大小和您的设备性能。通常英文识别在3-8秒内完成,中文识别可能需要8-20秒(因为中文字符集更大)。

首次使用时需要下载语言训练数据(约4-15MB),后续使用会更快,因为训练数据会被浏览器缓存。

建议图片宽度控制在2000px以内以获得最佳速度与准确率平衡。过大的图片会增加处理时间,但不一定能提高识别准确率。

您可以在识别过程中观察进度条,了解当前处理状态。

支持哪些货币类型?如何设置税率?

工具支持多种常见货币类型,包括:人民币(¥)、美元($)、欧元(€)、英镑(£)、日元(JP¥)等。您可以在设置中选择收据对应的货币类型。

税率设置功能允许您自定义增值税或销售税的百分比。设置后,工具会根据小计金额自动计算税额,并与小计相加得到总计金额。

例如,如果您设置税率为13%,小计金额为100元,工具会自动计算税额为13元,总计为113元。这大大简化了财务计算过程。

可以处理多张收据吗?

当前版本支持一次处理一张收据。如果您有多张收据需要处理,可以逐张上传并处理。

对于每张收据,您可以选择导出为单独的CSV文件,或者复制表格数据后粘贴到同一个电子表格的不同工作表中。

我们正在考虑在未来版本中添加批量处理功能,让用户能够同时上传多张收据进行识别。目前建议逐张处理以确保识别准确率。