下载
解压就是全部安装过程
包里自带精简 Java 运行时,不用另装 Java,也不用装 Python。转换全程在本机完成。
首次运行。macOS 包已用 Developer ID 签名并经 Apple 公证,双击直接打开,不会被拦。 Windows 包未签名,第一次运行 SmartScreen 会提示一次:点「更多信息」→「仍要运行」即可,之后不再提示。
包里有什么
- 四个程序
- 命令行、图形界面、Web 常驻服务、MCP Server,共用同一份依赖
- Java 运行时
- 用 jlink 裁过的精简运行时,只带用得到的模块
- 工作目录
raw/(放待转文件)、output/(产物)、config.toml(默认参数)都在可执行文件旁边- 不含
- OCR 服务。它依赖较重(几个 GB),按需单独装,见下
用 pip 安装
需要 Python 3.10 或更高、Java 11 或更高。Java 是必需的——真正做版面分析的引擎是 Java 写的。
$ pip install "aimorsel[all]" # [all] = docx/xlsx/pptx/图片输入 + GUI 拖拽 + 坏 PDF 修复 $ java -version # 确认 Java 在 $ morsel --version
包名是 aimorsel(PyPI);pip install morsel 是它的别名,装到的是同一个包。
装完就有 morsel 命令,morsel gui / morsel web / morsel mcp 起另外三个程序。
从源码安装
$ git clone https://github.com/aimorsel/aimorsel.git $ cd aimorsel $ pip install -e ".[all]" $ morsel --version
必装的只有核心引擎和兜底网,其余都是可选 extras:缺哪个只影响对应功能,报错里会直接给出安装命令。 HTML 输入用标准库解析,不需要额外装东西。
扫描件与图片:另装 OCR
扫描件和图片没有文字层,要出文字得先装一次 OCR 服务。它是一个跑在本机的独立服务, 依赖装在单独的环境里,不污染系统,卸载就是删掉那个目录。
$ morsel --setup-ocr # 建环境、装依赖、启动服务 $ morsel --setup-ocr-lang "de,en" # 按文档语言指定 $ morsel --stop-ocr
语言要对得上。实测中影响识别质量最大的因素就是这个:
用中文模型识别德语文档,变音符号会全错、丢行严重,换成 de,en 后明显改善。
一批多语言文档需要按语言分批处理。
先知道这些限制
- 扫描件 OCR 适合检索和定位,不适合当忠实全文。印刷体正文可靠, 但数学公式基本丢失、手写标记基本忽略,过小的字号会丢行。
- 无边框表格的识别有限。底层默认靠边框找表格,遇到无边框表格要开增强表格识别。
- PDF 里字体编码映射坏掉时会出乱码,这属于源文件的问题,解析引擎无能为力。
- Web 服务没有访问控制,默认只绑本机,别暴露到不可信网络。