MarkItDown 檔案脫水術:PDF 先轉純文字,Claude 讀檔省 Token
小心你的 Token 就這樣白白燒掉了。
問題都還沒開始問,Token 就先被吃掉一大截。
這是什麼
MarkItDown 是微軟放在 GitHub 上的免費開源工具,能把 PDF、Word(.docx)、PPT(.pptx)、Excel、CSV 轉成 Markdown(.md)純文字檔。這篇教你把它做成「檔案脫水」拖曳工具:Windows 設定一次,以後把檔案拖上去,原檔旁邊就會多一份脫水後的 .md。
為什麼要多這一步?Claude 官方文件寫,用 API(寫程式串接 Claude 的方式)直接送 PDF 時,Claude 會把每一頁轉成一張圖片,同時抽出那頁的文字,兩份一起看,所以同一頁的文字和圖片都要算 Token(AI 計算用量的單位)。
官方估計文字部分每頁通常要 1,500 到 3,000 Token,每頁的圖片還要另外算。照這樣算,一份 30 頁的 PDF 光文字就可能用掉 4.5 萬到 9 萬 Token;字少的頁面會少很多,但不管頁面上有沒有圖,每一頁都還要另外算一張圖的 Token,比較新的模型也算得比較多,總數可能更高。
在 claude.ai 網頁或 App 上傳 PDF,100 頁以內 Claude 會連圖表一起看;101 到 1000 頁只讀文字;超過 1000 頁傳不上去。claude.ai 上每頁用掉多少 Token,官方沒有公布。
先轉成純文字再交給 Claude,就不用再為圖片花 Token,只算文字。不過 claude.ai 上超過 100 頁的 PDF 本來就只讀文字,這招省不到圖片那部分。
ChatGPT 的一般帳號(企業版 Enterprise 以外)在 App 或網頁上傳 PDF,本來就只讀文字,所以這招主要是給 Claude 用的(依 OpenAI 說明文件)。
誰需要
- 常把合約、逐字稿、會議紀錄這類字多的文件丟給 Claude 問問題的人
- 一次要丟好幾份文件給 Claude,擔心用量不夠的人
- 寫程式串接 Claude(API)大量處理 PDF、在意費用的人
- 看到黑色視窗、要打指令就想放棄的 Windows 使用者(只有第一次設定要貼幾行指令)
要不要錢
MarkItDown 免費,PDF、Word、PPT、Excel、CSV 都在你自己的電腦上轉,要先裝的 Python 也免費(2026-09-15 查證)。會收費的只有另外串接微軟 Azure 的雲端辨識服務,或接 AI 外掛做圖片辨識,照這篇的做法都用不到。轉好的文字丟給 Claude 之後,用量還是照你原本的 Claude 方案計算。
怎麼開始
第 1 到 7 步是 Windows,Mac 請直接看第 8、9 步。拖曳工具要用的批次檔(.bat)放在文章最下面的贈品教學裡。
- 確認 Python 版本:按開始鍵,直接打 powershell 按 Enter,在視窗輸入
python --version再按 Enter。看到 3.10 到 3.13 就跳到第 3 步;其他情況(找不到 Python、跳出 Microsoft Store,或版本不在這個範圍)就做第 2 步。 - 安裝 Python 3.13:到 python.org 的 Windows 下載頁,找 3.13 的「Windows installer (64-bit)」。官網現在預設給的是 3.14,裝了 3.14 第 3 步會失敗,一定要挑 3.13(2026-09-15 查證)。安裝第一頁下方的「Add python.exe to PATH」記得勾起來,裝完把 PowerShell 關掉重開。贈品教學寫的「3.10 以上」「3.12 以上」,請一律當成 3.10 到 3.13。
- 安裝 MarkItDown:貼上
pip install "markitdown[all]"按 Enter,跑出一大串英文是正常的,等它跑完;最後幾行如果出現 ERROR,就是沒裝成功,回第 1 步確認版本。如果顯示「無法辨識 'pip' 詞彙」,代表 PATH 沒勾到,把 Python 解除安裝後照第 2 步重裝。 - 輸入
markitdown --version按 Enter,看到 0.1.7 或更新的版本就裝好了。贈品教學寫「版本號的數字可能跟這裡不一樣,有出現就對了」,這裡請多看一眼數字,比 0.1.7 舊代表裝到舊版,回第 1 步檢查 Python。如果顯示「無法辨識 'markitdown' 詞彙」,照第 2 步重裝 Python 3.13,關掉 PowerShell 重開,再做第 3 步。 - 做拖曳工具:在檔案總管上方「檢視」的「顯示」勾選「副檔名」,再打開記事本,貼上贈品教學裡的批次檔,另存成「檔案脫水.bat」,存檔類型選「所有檔案」、編碼選 UTF-8,存到桌面。圖示變成齒輪狀才是存對。
- 把檔案拖到「檔案脫水.bat」上放開,轉好的 .md 會出現在原檔旁邊,一次拖好幾個也可以;同名的 .md 已經存在時,會自動加編號另存。舊版的 .doc、.ppt 不支援,先另存成 .docx、.pptx 再拖。
- 打開轉好的 .md(跳出選擇程式時選記事本),按 Ctrl+A 全選、Ctrl+C 複製,貼進 Claude 的對話框,再打你的問題。
- Mac 先裝 Homebrew(Mac 上裝工具用的免費軟體):到 brew.sh,把首頁那行指令貼進「終端機」按 Enter。如果跳出安裝「命令列開發者工具」的視窗,按安裝沒關係。裝完後,畫面最後「Next steps」底下會列出幾行指令,也要照著複製貼上執行,不然下一步會顯示找不到 brew。
- Mac 安裝 MarkItDown:依序打
brew install pipx python@3.13和pipx ensurepath,關掉終端機重開,再打pipx install --python "$(brew --prefix python@3.13)/bin/python3.13" 'markitdown[all]'。裝完打pipx list,看到 markitdown 0.1.7 或更新的版本才對;之前照贈品教學裝過、或版本比 0.1.7 舊,先打pipx uninstall markitdown再重打一次上面那行。贈品 Mac 那頁說的「不要按安裝」「去 python.org 下載」和三行 pipx 指令,請一律以這裡為準。Mac 沒有拖曳工具,轉檔時打markitdown 你的檔案.pdf -o 輸出檔名.md,輸出檔名如果跟現有的檔案同名,會直接蓋掉,不會問你。
小提醒
檔案的重點在圖表,就直接把原始 PDF 丟給 Claude,不要脫水。
- 轉成純文字之後,圖片、流程圖和圖表裡的內容都會不見。合約、逐字稿這類字多圖少的檔案,才適合脫水。
- PDF 裡的表格最不穩。MarkItDown 不看格線,而是看文字排得整不整齊:3 欄以上、格子裡字很短的表比較容易轉成表格;2 欄的表、格子裡寫長句的表,常會被攤平成一行一行的文字。重要數字記得對照原檔。
- 掃描版 PDF 轉不出字。拍照或掃描存成的 PDF 沒有文字層,轉出來幾乎是空的;頁數多的時候拖曳工具不一定會提示,轉完打開看一眼最保險。
- 這篇裝的 MarkItDown 包含音檔轉逐字稿,會把整段音檔送到 Google 的語音辨識。把 .mp3、.m4a、.wav 或 .mp4 拖上去就可能直接送出,有機密的錄音或影片不要拖。輸入網址(例如 YouTube 連結)也需要連網。
- Windows 電腦如果是 ARM 處理器(例如 Snapdragon 筆電),MarkItDown 需要的元件目前沒有 ARM 版,照這篇可能裝不起來。Mac 最好是 macOS 14 以上:macOS 13 要花很久從原始碼編 Python,也不一定成功;macOS 12 以下不管哪種晶片都裝不起來。
- 批次檔跑出一堆錯誤,或拖上去沒反應,贈品教學最後的「常見問題」有圖解,照著檢查就好。
本文發表於 2026-09-15。步驟依官方說明與贈品教學整理,Python 官網和 MarkItDown 日後可能調整,以官方為準。
加 LINE 好友 → 輸入暗號 脫水→ 系統立刻自動送你完整版。
加 LINE 領取