很多老财报、审计报告只有扫描版 PDF,没法直接复制数据。
使用说明
正文里推荐了工具组合,点链接去各工具官网注册 / 下载,按顺序搭配使用。
Usage Brief
适合人群
扫描版财报/合同/票据的数字化。Apache-2.0 许可,可商用。
使用场景
财务分析 / 工具组合 / 文档解析 / 数据清洗
MCP 状态
已通过 MCP 准入,可在完成连接后由 Agent 搜索和调用。
使用边界
适合处理已脱敏或可公开讨论的工作材料;最终判断仍由使用者负责。
很多老财报、审计报告只有扫描版 PDF,没法直接复制数据。PaddleOCR 是百度开源的 OCR 引擎,能把扫描版财务报表、图片、PDF高精度转成可编辑的结构化数据(表格、文本)。
pip install paddlepaddle paddleocrPaddleOCR(use_angle_cls=True).ocr('财报.pdf')PaddleOCRPPStructure()70000+ star,Dify、RAGFlow 等知名项目的底层 OCR 引擎。新版本 PaddleOCR-VL 支持 Markdown/JSON 结构化输出,准确率 96%+。适合需要处理扫描版财报、合同、票据的财务和尽调团队。
📦 来源:PaddlePaddle/PaddleOCR(原作者:PaddlePaddle)
📜 许可:Apache-2.0 · 允许分享与修改,需保留来源声明
🔧 用法:见「怎么用」说明,或访问原仓库获取最新版本
Quality & Source
Skill Quality
结构完整,适合进入收藏与 MCP 调用。
80
优秀
输入示例
输入你的业务对象、当前目标和已有材料。
输出预期
输出结构化表格,包含判断、证据、风险和下一步动作。
已具备
建议补齐
外显信息
本 Skill 仅用于辅助分析和内容生成,不构成投资建议、法律意见、财务意见、税务意见、审计意见或合规意见。请结合实际情况和专业判断使用。详见 免责声明。
补充说明
pip install paddlepaddle paddleocr。表格识别用 PP-Structure 模块。也可封装成 MCP server。
适合扫描版财报/合同/票据的数字化。Apache-2.0 许可,可商用。