An open API service providing package, version and dependency metadata of many open source software ecosystems and registries.

pypi.org "table-extraction" keyword

Top 7.3% on pypi.org
mdify-cli 3.7.0
Convert PDFs and document images into structured Markdown for LLM workflows
74 versions - Latest release: 7 months ago - 1.11 thousand downloads last month - 0 stars on GitHub - 1 maintainer
Top 7.1% on pypi.org
img2table 2.0.0
img2table is a table identification and extraction Python Library for PDF and images, based on Op...
58 versions - Latest release: 5 months ago - 1 dependent package - 4 dependent repositories - 114 thousand downloads last month - 901 stars on GitHub - 1 maintainer
xberg-cli 1.3.6 💰
CLI proxy for xberg — downloads and runs the native xberg binary from GitHub releases.
55 versions - Latest release: 1 day ago - 6.39 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
surrealdb-xberg 1.3.6 💰
Xberg-to-SurrealDB connector for document ingestion pipelines — schema management, content dedupl...
36 versions - Latest release: 1 day ago - 1.8 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
crewai-xberg 1.3.6 💰
Xberg document extraction tools for CrewAI agents — text, metadata, and batch extraction across 1...
37 versions - Latest release: 1 day ago - 1.94 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
llama-index-node-parser-xberg 1.3.6 💰
Structure-aware LlamaIndex node parser that turns xberg native chunks and elements into nodes
37 versions - Latest release: 1 day ago - 2 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
txtai-xberg 1.3.6 💰
Xberg document extraction and chunking pipeline for txtai embeddings
34 versions - Latest release: 1 day ago - 1.85 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
langchain-xberg 1.3.6 💰
LangChain document loader for Xberg — extract 88+ file formats into Documents with async, batchin...
37 versions - Latest release: 1 day ago - 2.04 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
xberg-hermes-plugin 1.3.6 💰
Local document extraction: text, tables, metadata, images from 107 formats with optional OCR.
28 versions - Latest release: 2 days ago - 1.18 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
llama-index-readers-xberg 1.3.6 💰
LlamaIndex reader for 107 document formats powered by xberg's Rust extraction engine
37 versions - Latest release: 1 day ago - 2.01 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
xberg 1.3.6 💰
High-performance document intelligence library
56 versions - Latest release: 1 day ago - 80.7 thousand downloads last month - 9,388 stars on GitHub - 1 maintainer
Top 1.8% on pypi.org
pymupdfb 1.24.10
MuPDF shared libraries for PyMuPDF.
18 versions - Latest release: about 2 years ago - 4 dependent packages - 133 dependent repositories - 1.97 million downloads last month - 10,852 stars on GitHub - 1 maintainer
aqpymupdf 1.23.7
A high performance Python library for data extraction, analysis, conversion & manipulation of PDF...
1 version - Latest release: over 2 years ago - 91 downloads last month - 10,852 stars on GitHub - 1 maintainer
Top 0.8% on pypi.org
pdfplumber 0.11.10
Plumb a PDF for detailed information about each char, rectangle, and line.
76 versions - Latest release: 4 months ago - 118 dependent packages - 1,210 dependent repositories - 40.7 million downloads last month - 10,786 stars on GitHub - 1 maintainer
pdfplumber-aemc 0.11.3
Plumb a PDF for detailed information about each char, rectangle, and line.
16 versions - Latest release: over 2 years ago - 1 dependent repositories - 110 downloads last month - 10,786 stars on GitHub - 1 maintainer
document-ai-toolkit 0.1.0
Comprehensive document processing toolkit for AI/ML applications
1 version - Latest release: 9 months ago - 38 downloads last month - 1 maintainer
tablers 0.9.0
A blazingly fast PDF table extraction library with python API powered by Rust
17 versions - Latest release: 3 days ago - 2.16 thousand downloads last month - 12 stars on GitHub - 1 maintainer
Top 1.4% on pypi.org
pymupdf 1.28.2
A high performance Python library for data extraction, analysis, conversion & manipulation of PDF...
144 versions - Latest release: 2 months ago - 206 dependent packages - 1,798 dependent repositories - 83.2 million downloads last month - 10,852 stars on GitHub - 1 maintainer
ingest-cli 1.0.2
High-quality document processing for RAG pipelines, supporting multiple formats and processing ba...
1 version - Latest release: 10 months ago - 41 downloads last month - 1 stars on GitHub - 1 maintainer
alice-pdf 0.2.0
Extract tables from PDFs using Mistral OCR
5 versions - Latest release: about 2 months ago - 41 downloads last month - 19 stars on GitHub - 1 maintainer
pdftablr 0.1.0
Python3 implementation of Kyle Cronan's pdftable module, with unit tests
1 version - Latest release: almost 9 years ago - 1 dependent repositories - 181 downloads last month - 2 stars on GitHub - 1 maintainer
pdf-to-xls-vision 1.0.6
Convert PDF and image tables to Excel using Claude Vision API with automatic validation and multi...
7 versions - Latest release: 11 months ago - 150 downloads last month - 1 maintainer
neocr 0.1.0
NeoCR is a hierarchical, context-aware OCR system for mixed-content documents
1 version - Latest release: 12 months ago - 58 downloads last month - 0 stars on GitHub - 1 maintainer
tableta 0.2.1
Extractor de tablas desde notas en PDFs de estados financieros (con detección mejorada)
6 versions - Latest release: 12 months ago - 25 downloads last month - 0 stars on GitHub - 1 maintainer
docling-enhanced-onnx 1.0.0
Enhanced Docling Models with ONNX Auto-Detection and Air-Gapped Support
1 version - Latest release: about 1 year ago - 176 downloads last month - 0 stars on GitHub - 1 maintainer
docstrange 1.1.8
Extract and Convert PDF, Word, PowerPoint, Excel, images, URLs into multiple formats (Markdown, J...
19 versions - Latest release: 11 months ago - 1.05 thousand downloads last month - 1,577 stars on GitHub - 1 maintainer
document-data-extractor 1.0.4
Best open-source document to markdown extractor for LLM training data. Convert PDF, Word, PowerPo...
5 versions - Latest release: about 1 year ago - 23 downloads last month - 8 stars on GitHub - 1 maintainer
llm-data-converter 2.2.0
Best open-source document to markdown converter for LLM training data. Convert PDF, Word, PowerPo...
23 versions - Latest release: about 1 year ago - 20 downloads last month - 8 stars on GitHub - 1 maintainer
gridgulp 0.3.4
Simplified intelligent spreadsheet ingestion framework with automatic table detection
2 versions - Latest release: about 1 year ago - 1.06 thousand downloads last month - 13 stars on GitHub - 1 maintainer
mseep-kreuzberg 3.13.5
Document intelligence framework for Python - Extract text, metadata, and structured data from div...
4 versions - Latest release: about 1 year ago - 12 downloads last month - 9,376 stars on GitHub - 1 maintainer
docext 0.1.14
Onprem information extraction from documents
12 versions - Latest release: over 1 year ago - 108 downloads last month - 2,086 stars on GitHub - 1 maintainer
markdrop 4.1.2
A comprehensive PDF processing toolkit that converts PDFs to markdown with advanced AI-powered fe...
27 versions - Latest release: 2 months ago - 303 downloads last month - 210 stars on GitHub - 2 maintainers
kreuzberg 4.9.9
High-performance document intelligence library for Python. Extract text, metadata, and structured...
160 versions - Latest release: 4 months ago - 162 thousand downloads last month - 9,349 stars on GitHub - 1 maintainer
pdfmux 1.8.7 💰
Self-healing PDF extraction for RAG — #2 of 8 engines on opendataloader-bench (0.903). Flags page...
26 versions - Latest release: 2 months ago - 3.74 thousand downloads last month - 82 stars on GitHub - 1 maintainer
grits-metric 0.6.0
GriTS metrics
1 version - Latest release: 6 months ago - 1.84 thousand downloads last month - 3 stars on GitHub - 1 maintainer
pdf-mcp 3.4.0
Gives AI agents agentic RAG over one PDF or a whole folder of them: hybrid semantic + keyword sea...
35 versions - Latest release: 13 days ago - 5.62 thousand downloads last month - 147 stars on GitHub - 1 maintainer
duekit 0.2.0
Configurable due-date monitoring: flexible daily scheduling (fixed times/intervals, one or more t...
1 version - Latest release: 10 days ago - 0 downloads last month - 1 maintainer
docberry 0.1.2
Extract structured Markdown, tables, figures, and equations from scientific PDFs with proper read...
3 versions - Latest release: 6 months ago - 66 downloads last month - 1 maintainer
table-transformer 1.0.6
Table Transformer
5 versions - Latest release: about 2 years ago - 112 downloads last month - 2,946 stars on GitHub - 1 maintainer
bolivar 2.2.1
Fast PDF content extraction, written in Rust with Python bindings
21 versions - Latest release: about 1 month ago - 15.5 thousand downloads last month - 1 stars on GitHub - 1 maintainer
extracttable 2.4.0
Extract table data from images and scanned PDFs. Easily convert image to excel, convert pdf to table
16 versions - Latest release: about 4 years ago - 1 dependent repositories - 2.11 thousand downloads last month - 286 stars on GitHub - 1 maintainer
extractable 1.0.2
Extract tables from PDFs
124 versions - Latest release: over 2 years ago - 1 dependent repositories - 620 downloads last month - 32 stars on GitHub - 1 maintainer
mcp-pdf 2026.9.22
Secure FastMCP server for comprehensive PDF processing - text extraction, OCR, table extraction, ...
34 versions - Latest release: 17 days ago - 931 downloads last month - 10 stars on GitHub - 1 maintainer
tablecv 0.2.2
Extract table-shaped data from OCR text boxes.
5 versions - Latest release: 3 months ago - 313 downloads last month - 11 stars on GitHub - 1 maintainer
pdf-rtldoc 1.4.0
Geometry-first PDF parser for RTL and complex layouts (Arabic textbooks, financial tables, multi-...
7 versions - Latest release: about 1 month ago - 540 downloads last month - 0 stars on GitHub - 1 maintainer
saraldocling 1.0.1
Fast PDF text and image/table extraction using PyMuPDF + YOLOv8 DocLayNet ONNX
2 versions - Latest release: 4 months ago - 118 downloads last month - 1 maintainer
tableshot 0.1.1
Extract tables from PDFs into clean, structured data -- instantly. An MCP server for AI assistants.
2 versions - Latest release: 7 months ago - 63 downloads last month - 1 maintainer
pylopdf 0.13.0
PDF editing, rendering, extraction, and generation for Python, powered by Rust. MIT, no mandatory...
11 versions - Latest release: 2 months ago - 3.74 thousand downloads last month - 1 stars on GitHub - 1 maintainer
trimitdown-pdf 0.1.0
Table-detection stage for ruled PDF grids on top of pdfplumber: tells a real table from a page fr...
1 version - Latest release: 3 months ago - 0 stars on GitHub - 1 maintainer
cocoapdf 0.10.3
CocoaPDF: deterministic PDF-to-Markdown/HTML conversion for structured text-layer PDFs. No OCR. N...
1 version - Latest release: about 2 months ago - 65 downloads last month - 1 stars on GitHub - 1 maintainer
ai-hwp-reader 0.5.2
ChatGPT·Claude·Gemini가 HWP·HWPX의 본문·표·메모·변경추적·각주·링크·수식을 구조대로 읽고 일하게 하는 AI용 한글 문서 리더.
5 versions - Latest release: about 2 months ago - 0 stars on GitHub - 1 maintainer
quipucamayoc 0.1.2
Tools to extract information from digitized historical documents
2 versions - Latest release: over 4 years ago - 1 dependent repositories - 20 downloads last month - 33 stars on GitHub - 1 maintainer
ragtable-extract 0.1.1
PDF table extraction for RAG and LLM — convert PDF tables to clean HTML. Fast, local, no GPU. Han...
2 versions - Latest release: 7 months ago - 19 downloads last month - 2 stars on GitHub - 1 maintainer
distillpdf 0.1.4
Pure-Rust PDF extraction that distills documents into clean, LLM-ready HTML — for LLMs and RAG, b...
39 versions - Latest release: about 1 month ago - 561 downloads last month - 1 stars on GitHub - 1 maintainer
doc-intel-kit 0.1.0
Composable document parsing, OCR, table extraction, structured extraction, LLM tasks, and in-memo...
1 version - Latest release: about 2 months ago - 1 maintainer
depdf 0.2.2
PDF table & paragraph extractor
4 versions - Latest release: over 6 years ago - 1 dependent repositories - 32 downloads last month - 11 stars on GitHub - 1 maintainer
pdf-agent-mcp 0.1.2
An MCP server that lets AI agents extract text and tables from PDFs (invoices, reports, statements).
3 versions - Latest release: 2 months ago - 1 maintainer
ytcc-pipeline 0.2.0
PDF processing pipeline for academic theses.
1 version - Latest release: 5 months ago - 1 maintainer
agentic-rag-pdf 0.1.5
Agentic RAG over any PDF — grounded, cited answers from research reports, ESG/sustainability disc...
4 versions - Latest release: 5 months ago - 1 maintainer
Top 9.0% on pypi.org
docfold 0.6.13
Turn any document into structured data. Unified interface for document structuring engines with b...
18 versions - Latest release: 7 months ago - 226 downloads last month - 1 maintainer
docqwise 0.2.0
Read, Extract, Retrieve: Document intelligence that adapts, accelerates, and scales.
3 versions - Latest release: 2 months ago - 1 maintainer
ragtab 0.1.6
Table extraction from images to Markdown for RAG systems
5 versions - Latest release: 5 months ago - 1 stars on GitHub - 1 maintainer
pepsico-document-parser 0.1.0
Unified parsing abstraction layer for document extraction providers
1 version - Latest release: 4 months ago - 1 maintainer
pdfprep 0.2.2
PDF 전처리 통합 도구 — 메타데이터, 텍스트 파싱, OCR, 표 추출
6 versions - Latest release: 4 months ago - 115 downloads last month - 1 maintainer
paperjam 0.1.3
Fast PDF processing powered by Rust
4 versions - Latest release: 7 months ago - 243 downloads last month - 1 maintainer
pdfmod 0.1.5
A tool for PDF file manipulation.
1 version - Latest release: almost 2 years ago - 24 downloads last month - 7,114 stars on GitHub - 1 maintainer
iqedge-ai-ocr 0.2.0
IQEdge.ai OCR — PDF to Text converter with multi-pass self-correction. Extract text from scanned ...
2 versions - Latest release: 6 months ago - 95 downloads last month - 1 maintainer
exactpdfgrid 0.1.4
Extract bordered tables from PDFs and export them to Excel (.xlsx).
4 versions - Latest release: 3 months ago - 1 maintainer
pyany2json 0.1.3
Python binding to Any2Json
4 versions - Latest release: over 2 years ago - 24 downloads last month - 0 stars on GitHub - 1 maintainer
Related Keywords
pdf 48 ocr 42 python 28 rag 26 text-extraction 22 llm 19 pdf-extraction 18 tesseract 16 rust 16 document-processing 13 document-intelligence 12 ai 12 metadata-extraction 11 bun 11 csharp 11 elixir 11 ffi 11 golang 11 wasm 11 java 11 node 11 pdfium 11 php 11 ruby 11 document-ai 10 markdown 10 mcp 8 pdf-to-markdown 7 document-parsing 7 nlp 7 pymupdf 6 xberg 6 document-extraction 5 document-analysis 5 extraction 5 docling 5 pdf-parser 5 mupdf 4 pdf-documents 4 text-processing 4 text-shaping 4 xps 4 claude 4 docling-alternative 4 image-processing 4 pdf-to-html 4 excel 4 model-context-protocol 4 document-understanding 4 pdf-parsing 4 document 4 structured-data 4 document-conversion 4 data-science 4 font 4 extract-data 4 epub 4 html-to-markdown 3 local-document-processing 3 opencv 3 marker-alternative 3 html 3 layout-analysis 3 paddleocr-alternative 3 markitdown-alternative 3 xlsx 3 chunking 3 machine-learning 3 word-to-markdown 3 vector-search 3 table-detection 3 mineru-alternative 3 csv 3 unstructured-alternative 3 langchain 3 llamaindex 3 layout-detection 3 tables 3 document-to-markdown 3 excel-to-markdown 3 anthropic 3 tesseract-alternative 3 intelligent-document-processing 3 table-structure-recognition 3 structured-data-extraction 3 powerpoint-to-markdown 3 llm-ready-data 3 ai-training-data 3 ai-agent 3 mcp-server 3 pdf-to-text 3 batch-document-processing 3 agents 2 offline-document-extractor 2 parsing 2 retrieval-augmented-generation 2 ppt-to-markdown 2 semantic-search 2 embeddings 2 offline-document-converter 2