共計 919 個字符,預(yù)計需要花費 3 分鐘才能閱讀完成。
要使用 Python 批量提取 PDF 中的信息,可以使用 Python 的一個庫叫做 PyPDF2。下面是一個簡單的例子,可以幫助你開始提取 PDF 中的文本信息:
首先,你需要安裝 PyPDF2 庫。可以使用以下命令在終端或命令提示符中安裝該庫:
pip install PyPDF2
然后,你可以使用以下代碼來提取 PDF 中的文本信息:
import PyPDF2
def extract_text_from_pdf(pdf_path):
with open(pdf_path, 'rb') as file:
pdf = PyPDF2.PdfFileReader(file)
text = ""
for page_number in range(pdf.getNumPages()):
page = pdf.getPage(page_number)
text += page.extractText()
return text
# 批量提取 PDF 中的文本信息
pdf_folder = "pdf 文件夾路徑 "
output_folder = " 輸出文件夾路徑 "
import os
for filename in os.listdir(pdf_folder):
if filename.endswith(".pdf"):
pdf_path = os.path.join(pdf_folder, filename)
text = extract_text_from_pdf(pdf_path)
output_path = os.path.join(output_folder, f"{filename}.txt")
with open(output_path, 'w', encoding='utf-8') as file:
file.write(text)
在上面的代碼中,pdf_folder
是包含 PDF 文件的文件夾的路徑,output_folder
是將提取的文本輸出到的文件夾路徑。代碼將遍歷文件夾中的所有 PDF 文件,提取每個文件的文本內(nèi)容,并將提取的文本保存到相應(yīng)的文本文件中。
請注意,該代碼只能提取 PDF 中的純文本信息,如果 PDF 中包含圖像或表格等非文本內(nèi)容,該代碼可能無法提取或正確提取。
丸趣 TV 網(wǎng) – 提供最優(yōu)質(zhì)的資源集合!
正文完