Workflow 05

PDF 清理:提升易讀性,但不改寫原始證據

OCR、Markdown 與文本分塊有助於理解內容;關鍵引用仍須對照原始 PDF 或出版者版本。

保留原始檔案

完整記錄來源、版本、取得日期、授權狀態與檔案雜湊值;切勿以清理後的檔案覆蓋原始文件。

選擇清理方式

具文字層之檔案可直接擷取;掃描文件可透過 OCR 辨識;長篇文件建議分段處理並保留原始頁碼。

抽樣回查核對

核對頁碼順序、標題、表格、公式、參考文獻與原始頁碼,並特別留意欄位錯位與 OCR 辨識錯誤。

標記辨識失真

無法確認的字詞、公式或數值應標記為「待查」,切勿直接納入論述主張。

三種檔案的定位與分工

檔案類型主要用途
原始 PDF供最終引用確認與證據回溯查核。
清理後的 Markdown供日常閱讀、檢索、結構整理與關聯串接。
OCR 辨識文字使掃描頁面具備檢索功能;使用時須留意辨識誤差。
銜接下一步:使用清理後的版本建立文獻矩陣(Literature Matrix),但各項主張皆須保留原始頁碼以供定位。

銜接至文獻矩陣與文獻樹