pypi.org "pdf-parser" keyword
Top 0.4% on pypi.org
112 versions - Latest release: about 1 month ago - 390 dependent packages - 3,809 dependent repositories - 125 million downloads last month - 8,259 stars on GitHub - 2 maintainers
pypdf 6.14.2
A pure-python PDF library capable of splitting, merging, cropping, and transforming PDF files112 versions - Latest release: about 1 month ago - 390 dependent packages - 3,809 dependent repositories - 125 million downloads last month - 8,259 stars on GitHub - 2 maintainers
Top 9.9% on pypi.org
6 versions - Latest release: almost 6 years ago - 3 dependent repositories - 451 downloads last month - 42 stars on GitHub - 1 maintainer
pyxpdf 0.2.3
Powerful and Pythonic PDF processing library based on xpdf-4.026 versions - Latest release: almost 6 years ago - 3 dependent repositories - 451 downloads last month - 42 stars on GitHub - 1 maintainer
doctra 0.9.7
Parse, extract, and analyze documents with ease26 versions - Latest release: 9 months ago - 269 downloads last month - 29 stars on GitHub - 1 maintainer
oxidize-pdf 0.16.0
Python bindings for oxidize-pdf — generate, parse, split, merge, and manipulate PDF files25 versions - Latest release: 13 days ago - 6.26 thousand downloads last month - 0 stars on GitHub - 1 maintainer
Top 0.4% on pypi.org
66 versions - Latest release: over 3 years ago - 160 dependent packages - 1,626 dependent repositories - 25 million downloads last month - 7,337 stars on GitHub - 2 maintainers
pypdf2 3.0.1
A pure-python PDF library capable of splitting, merging, cropping, and transforming PDF files66 versions - Latest release: over 3 years ago - 160 dependent packages - 1,626 dependent repositories - 25 million downloads last month - 7,337 stars on GitHub - 2 maintainers
docstrange 1.1.8
Extract and Convert PDF, Word, PowerPoint, Excel, images, URLs into multiple formats (Markdown, J...19 versions - Latest release: 9 months ago - 1.23 thousand downloads last month - 1,382 stars on GitHub - 1 maintainer
pdfnaut 0.12.0
Explore PDFs with ease15 versions - Latest release: 3 months ago - 161 downloads last month - 0 stars on GitHub - 1 maintainer
poste-italiane-parser 0.1.0
A Python parser for Poste Italiane financial documents.1 version - Latest release: about 1 year ago - 13 downloads last month - 50 stars on GitHub - 1 maintainer
lazyllm-magic-pdf 0.9.0
A practical tool for converting PDF to Markdown1 version - Latest release: over 1 year ago - 97 downloads last month - 60,832 stars on GitHub - 1 maintainer
Top 7.6% on pypi.org
7 versions - Latest release: over 2 years ago - 2 dependent packages - 1 dependent repositories - 3.08 thousand downloads last month - 433 stars on GitHub - 1 maintainer
scipdf-parser 0.52
Python parser for scientific PDF based on GROBID.7 versions - Latest release: over 2 years ago - 2 dependent packages - 1 dependent repositories - 3.08 thousand downloads last month - 433 stars on GitHub - 1 maintainer
mineru 3.4.4
A practical document parsing tool for converting PDF, images, DOCX, PPTX, and XLSX into Markdown ...84 versions - Latest release: 25 days ago - 323 thousand downloads last month - 55,106 stars on GitHub - 1 maintainer
taxformatter 0.1.1
Official Python SDK for the TaxFormatter API — parse crypto CSVs and bank statement PDFs1 version - Latest release: 3 months ago - 39 downloads last month - 1 maintainer
dongler 0.3.17
Fast Rust-native PDF and document extraction for Python, with Markdown, LaTeX, and JSON output.20 versions - Latest release: about 2 months ago - 186 downloads last month - 0 stars on GitHub - 1 maintainer
pdf-oxide 0.3.77 💰
The fastest Python PDF library — 0.8ms mean, 5× faster than the industry leaders, 100% pass rate ...82 versions - Latest release: 7 days ago - 145 thousand downloads last month - 696 stars on GitHub - 1 maintainer
distillpdf 0.0.34
Pure-Rust PDF extraction that distills documents into clean, LLM-ready HTML — for LLMs and RAG, b...34 versions - Latest release: about 2 months ago - 5.84 thousand downloads last month - 1 maintainer
bach-google-search-pse 0.2.5
Google 可编程搜索引擎 MCP 服务器 - 提供关键词搜索、URL内容获取和PDF解析功能2 versions - Latest release: 10 months ago - 81 downloads last month - 0 stars on GitHub - 1 maintainer
pdftools.pdfposter 0.8.1
Scale and tile PDF images/pages to print on multiple pages.9 versions - Latest release: over 3 years ago - 3 dependent repositories - 286 downloads last month - 8,945 stars on GitHub - 1 maintainer
smart-llm-loader 0.1.0
A powerful PDF processing toolkit that seamlessly integrates with LLMs for intelligent document c...1 version - Latest release: over 1 year ago - 15 downloads last month - 66 stars on GitHub - 1 maintainer
vision-parse 0.1.13
Parse PDF documents into markdown formatted content using Vision LLMs14 versions - Latest release: over 1 year ago - 1.27 thousand downloads last month - 430 stars on GitHub - 1 maintainer
tetebeche 0.1.1
Script to generate a tėte-bêche book from two pdfs2 versions - Latest release: almost 4 years ago - 47 downloads last month - 8,969 stars on GitHub - 1 maintainer
llmdocparser 0.1.6
Using LLM to parse PDF and get better chunk for retrieval8 versions - Latest release: almost 2 years ago - 203 downloads last month - 269 stars on GitHub - 1 maintainer
resumeminer 0.1.0
A lightweight Python library for extracting structured information from PDF resumes1 version - Latest release: about 2 months ago - 0 stars on GitHub - 1 maintainer
ppocrlabel-japan 0.0.2
PPOCRLabelv2 is a semi-automatic graphic annotation tool suitable for OCR field, with built-in PP...2 versions - Latest release: about 3 years ago - 93 downloads last month - 82,970 stars on GitHub - 1 maintainer
opendataloader-pdf 2.5.0
A Python wrapper for the opendataloader-pdf Java CLI.67 versions - Latest release: 21 days ago - 148 thousand downloads last month - 20,423 stars on GitHub - 1 maintainer
bubt-routinepy 1.0.0
An unofficial Python wrapper of the BUBT Routine API + a robust web scraper and PDF extractor for...1 version - Latest release: about 1 year ago - 16 downloads last month - 0 stars on GitHub - 1 maintainer
pdf-bank-statement-parser 0.1.1
Command-line tool for converting PDF bank statements into CSV2 versions - Latest release: almost 2 years ago - 76 downloads last month - 5 stars on GitHub - 1 maintainer
docuquery-ai 0.1.1
A powerful document query system using RAG and LLM technologies2 versions - Latest release: about 1 year ago - 36 downloads last month - 0 stars on GitHub - 1 maintainer
findimagespdf 0.1.2
Search and save images from PDF files.3 versions - Latest release: about 1 year ago - 28 downloads last month - 0 stars on GitHub - 1 maintainer
extractous 0.3.0
Extractous Python Binding8 versions - Latest release: over 1 year ago - 38.8 thousand downloads last month - 1,217 stars on GitHub - 1 maintainer
pdfdecrypt 1.0
Remove passwords from PDF documents1 version - Latest release: over 3 years ago - 26 downloads last month - 7,337 stars on GitHub - 1 maintainer
ai-resume-screener 0.1.0
AI-powered resume screening tool using LLMs and Streamlit1 version - Latest release: about 1 year ago - 51 downloads last month - 0 stars on GitHub - 1 maintainer
rdf-generator 0.1.4
A library for generating RDF datasets from various data sources1 version - Latest release: over 1 year ago - 50 downloads last month - 1 stars on GitHub - 1 maintainer
taxformatter-sdk 0.1.0
Official Python SDK for the TaxFormatter API — parse crypto CSVs and bank statement PDFs1 version - Latest release: 4 months ago - 18 downloads last month - 1 maintainer
pdfbook 0.1.0
Rearrange pages in PDFs for printing books1 version - Latest release: over 3 years ago - 44 downloads last month - 7,337 stars on GitHub - 1 maintainer
pdfmux 1.8.2
Self-healing PDF extraction for RAG that flags pages it can't read instead of dropping them — and...21 versions - Latest release: 19 days ago - 2.8 thousand downloads last month - 1 maintainer
pdf-oxide-fips 0.3.74
The fastest Python PDF library: 0.8ms mean, 5× faster than PyMuPDF. Text extraction, markdown con...27 versions - Latest release: 21 days ago - 166 downloads last month - 1 maintainer
declatravaux 0.1.11
Utilitaire de transmission de déclarations issues de la plateforme http://www.reseaux-et-canalisa...11 versions - Latest release: over 5 years ago - 1 dependent repositories - 79 downloads last month - 7,337 stars on GitHub - 1 maintainer
je-paddleocr 2.9.1
Awesome OCR toolkits based on PaddlePaddle(8.6M ultra-lightweight pre-trained model, support trai...1 version - Latest release: over 1 year ago - 175 downloads last month - 71,230 stars on GitHub - 1 maintainer
scipdf-mirror 0.1.dev0
Python parser for scientific PDF based on GROBID.1 version - Latest release: almost 4 years ago - 1 dependent repositories - 17 downloads last month - 433 stars on GitHub - 1 maintainer
xh-pdf-parser 1.3.1.2
A practical tool for converting PDF to Markdown5 versions - Latest release: over 1 year ago - 28 downloads last month - 55,106 stars on GitHub - 1 maintainer
pdf-heading-parser 0.1.0
A Python library to parse headings and subheadings from PDF files.1 version - Latest release: almost 2 years ago - 23 downloads last month - 2 stars on GitHub - 1 maintainer
kritrim-smriti 1.3.2
An offline-capable, multi-provider AI study assistant for PDF books with VARK learning modes8 versions - Latest release: about 2 months ago - 307 downloads last month - 2 stars on GitHub - 1 maintainer
pypdfbox 1.0.0rc1
Python-native port of Apache PDFBox-compatible APIs (Apache 2.0)1 version - Latest release: 30 days ago - 1 maintainer
mseep-pdf2md 0.1.4
PDF to Markdown MCP服务器5 versions - Latest release: 11 months ago - 47 downloads last month - 32,851 stars on GitHub - 1 maintainer
langchain-paddleocr 0.2.2
An integration package connecting PaddleOCR and LangChain4 versions - Latest release: about 2 months ago - 96 downloads last month - 73,099 stars on GitHub - 1 maintainer
kitty-doc 0.1.0
A practical tool for converting PDF to Markdown1 version - Latest release: 11 months ago - 43 downloads last month - 7 stars on GitHub - 1 maintainer
latex-toolkit 0.1
A high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具,将PDF转换成Markdown和JSON格式。1 version - Latest release: over 1 year ago - 18 downloads last month - 32,851 stars on GitHub - 1 maintainer
pdf2markdown 0.3.0
Python library and CLI tool that leverages LLMs to convert technical PDF documents to well-struct...2 versions - Latest release: 11 months ago - 244 downloads last month - 0 stars on GitHub - 1 maintainer
safepdf 1.0.14 💰
A safe PDF manipulation tool5 versions - Latest release: 4 months ago - 73 downloads last month - 6 stars on GitHub - 1 maintainer
pdflex 0.1.9
Python tools for PDF automation.7 versions - Latest release: over 1 year ago - 90 downloads last month - 3 stars on GitHub - 1 maintainer
magic-pdf 1.3.12
A practical tool for converting PDF to Markdown48 versions - Latest release: about 1 year ago - 69.9 thousand downloads last month - 55,106 stars on GitHub - 1 maintainer
prettyparser 1.0.15
Library for Parsing PDF/TXT and Python Objects with Text Using Regular Expressions1 version - Latest release: over 4 years ago - 1 dependent repositories - 11 downloads last month - 2 stars on GitHub - 1 maintainer
lexoid 0.1.22
Multimodal document parser for high quality data understanding and extraction22 versions - Latest release: about 2 months ago - 107 downloads last month - 44 stars on GitHub - 3 maintainers
pdfalyzer 1.19.6
Analyze PDFs with colors (and YARA). Visualize a PDF's inner tree-like data structure, check it a...82 versions - Latest release: 6 months ago - 1.49 thousand downloads last month - 335 stars on GitHub - 1 maintainer
paddleocrwordleveldetection 2.6.1.0
Awesome OCR toolkits based on PaddlePaddle (8.6M ultra-lightweight pre-trained model, support tra...1 version - Latest release: about 3 years ago - 155 downloads last month - 64,571 stars on GitHub - 1 maintainer
Top 6.8% on pypi.org
49 versions - Latest release: about 1 month ago - 9 dependent repositories - 16.1 thousand downloads last month - 161 stars on GitHub - 1 maintainer
casparser 1.2.1
(CAMS/KFintech/NSDL/CDSL) Consolidated Account Statement (CAS) PDF parser49 versions - Latest release: about 1 month ago - 9 dependent repositories - 16.1 thousand downloads last month - 161 stars on GitHub - 1 maintainer
dedoc 2.6.1
Extract content and logical tree structure from textual documents33 versions - Latest release: 8 months ago - 955 downloads last month - 592 stars on GitHub - 1 maintainer
flyer-composer 1.0
Rearrange PDF pages to print as flyers on one paper3 versions - Latest release: 12 months ago - 1 dependent repositories - 95 downloads last month - 9,001 stars on GitHub - 1 maintainer
cas-parser-python 1.2.1
The official Python library for the CAS Parser API5 versions - Latest release: 6 months ago - 35 downloads last month - 0 stars on GitHub - 1 maintainer
liteparse 2.0.8
Python bindings for LiteParse - fast, lightweight PDF and document parsing17 versions - Latest release: about 2 months ago - 90.2 thousand downloads last month - 9,598 stars on GitHub - 1 maintainer
stmtforge 1.0.1
Parse credit card PDF statements from Indian banks (HDFC, ICICI, SBI, Axis, Kotak + 4 more) into ...4 versions - Latest release: 2 months ago - 1 maintainer
Related Keywords
pdf
40
python
26
ocr
25
rag
14
pdf-converter
13
parser
12
pdf-manipulation
11
markdown
11
llm
11
pdf-extractor-rag
10
ai4science
10
pdf-documents
9
pdf-parsing
9
document-analysis
9
document-parsing
9
ai
8
pypdf2
8
help-wanted
8
extract-data
7
pdf-extractor-pretrain
6
document-processing
6
pdf-to-markdown
6
layout-analysis
6
pdf-extractor-llm
6
text-extraction
6
rust
5
pdf2markdown
5
nlp
4
pdf-extraction
4
document-translation
4
kie
4
openai
4
paddleocr-vl
4
pdf-to-text
4
pp-ocr
4
pp-structure
4
docx
4
chineseocr
4
document-parser
4
web-scraping
3
langchain
3
textdetection
3
textrecognition
3
paddleocr
3
table-extraction
3
pymupdf-alternative
3
csv-parser
3
python3
3
pdf-library
3
bank-statement
3
pdf-document
3
machine-learning
3
html
3
extraction
3
gemini
3
pdf-generation
3
chinesetextrecognition
3
chinesetextdetection
3
db
3
ocrlite
3
crnn
3
rosetta
3
east
3
star-net
3
scipdf-parser
2
tagged-pdf
2
html-parser
2
python-parser
2
grobid
2
Python PDF parser
2
GROBID
2
PDF parser
2
pdf-generator
2
pdf-document-processor
2
convert
2
ollama
2
xlsx
2
mineru
2
magic-pdf
2
multimodal
2
pdf-ua
2
ocr-recognition
2
crypto-tax
2
accessibility
2
taxformatter
2
documents
2
recruitment
2
chunking
2
data-extraction
2
cams
2
mcp
2
docling-alternative
2
document-understanding
2
pdfparser
2
document-conversion
2
pyo3
2
vlm
2
layout-detection
2
document-ai
2
document
2