要使用Python批量提取PDF中的信息,可以使用Python的一個庫叫做PyPDF2。下面是一個簡單的例子,可以幫助你開始提取PDF中的文本信息:
首先,你需要安裝PyPDF2庫。可以使用以下命令在終端或命令提示符中安裝該庫:
pip install PyPDF2
然后,你可以使用以下代碼來提取PDF中的文本信息:
import PyPDF2
def extract_text_from_pdf(pdf_path):
with open(pdf_path, 'rb') as file:
pdf = PyPDF2.PdfFileReader(file)
text = ""
for page_number in range(pdf.getNumPages()):
page = pdf.getPage(page_number)
text += page.extractText()
return text
# 批量提取PDF中的文本信息
pdf_folder = "pdf文件夾路徑"
output_folder = "輸出文件夾路徑"
import os
for filename in os.listdir(pdf_folder):
if filename.endswith(".pdf"):
pdf_path = os.path.join(pdf_folder, filename)
text = extract_text_from_pdf(pdf_path)
output_path = os.path.join(output_folder, f"{filename}.txt")
with open(output_path, 'w', encoding='utf-8') as file:
file.write(text)
在上面的代碼中,pdf_folder
是包含PDF文件的文件夾的路徑,output_folder
是將提取的文本輸出到的文件夾路徑。代碼將遍歷文件夾中的所有PDF文件,提取每個文件的文本內容,并將提取的文本保存到相應的文本文件中。
請注意,該代碼只能提取PDF中的純文本信息,如果PDF中包含圖像或表格等非文本內容,該代碼可能無法提取或正確提取。