它解决什么问题

很多知识库和 AI 工作流会卡在第一步:资料散落在 PDF、Word、PPT、Excel、网页或扫描件里,直接复制容易丢结构,整份丢给 AI 又常常夹杂页眉页脚、排版噪声和无效内容。

Markdown 的价值在于足够简单、足够通用,也足够省。标题、列表、引用、链接和图片关系都能用纯文本表达,AI 更容易理解结构;相比复杂版式文件,整理后的 Markdown 往往能减少无效 Token,让摘要、问答、改写和入库更省时间,也更省调用成本。

MarkAny 把这些文件统一转成 Markdown。文字版 PDF 会尽量保留标题层级、粗体、斜体等结构;扫描版 PDF 会走 OCR 识别;图片会提取到本地目录,方便后续继续整理。

当前公开版本聚焦“文档 → Markdown”单向转换,不主打 Markdown 反向导出 Word、PDF 或 PPT。

支持格式

PDF 文字版PyMuPDF 结构化提取,保留标题、粗体、斜体等信息。
PDF 扫描件渲染图片后通过 OpenCV 增强与 Tesseract OCR 识别中英文。
Office 文档支持 DOCX / DOC、XLSX / XLS、PPTX / PPT 转 Markdown。
网页与文本支持 HTML / HTM、TXT,并做自动编码检测。

使用流程

  1. 下载并安装“MarkAny-Setup-1.0.3.exe”。
  2. 打开 MarkAny,源文件格式保持“自动检测”即可。
  3. 拖入文件或点击选择文件,可一次添加多个文件。
  4. 设置输出目录,点击“开始转换”。
  5. 转换完成后,把生成的 Markdown 放进 Obsidian、Logseq 或其他知识库继续整理。

下载说明

当前 GitHub 发布页提供 Windows 安装器和压缩包。普通用户建议下载安装器“MarkAny-Setup-1.0.3.exe”。安装包约 245MB,原因是内置了 OCR 引擎和中英文语言包。

首次运行时,如果 Windows SmartScreen 出现安全提示,可以先确认下载来源为本项目 GitHub 仓库,再选择继续运行。

项目资料

项目源码公开在 GitHub。README 中记录了功能范围、支持格式、OCR 说明、安装方法和系统要求;仓库也保留了用户说明、设计文档与问题修复记录。