extractText

A simple tool for extracting text from PDF, EPUB, TXT, and DOCX files. This library was primarily developed for personal use in various NLP-related projects.

Parsers used:

pdfplumber, pytesseract, PyPDF2, pdf2image and PIL for PDF processing

ebooklib, bs4 for EPUB

docx for DOCX

Installation

Install text-extra using pip:

pip install text-extra

Usage

from text_extractor import extract_text

extracted_text = extract_text(file_path)
if isinstance(extracted_text, dict):
    for key, value in extracted_text.items():
        print(f"--- {key} ---\n{value}\n")
else:
    print(extracted_text)

Name		Name	Last commit message	Last commit date
Latest commit History 33 Commits
src		src
tests		tests
.DS_Store		.DS_Store
LICENSE		LICENSE
README.md		README.md
pyproject.toml		pyproject.toml
setup.py		setup.py

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

Repository files navigation

extractText

Parsers used:

Installation

Usage

About

Uh oh!

Releases

Packages

Uh oh!

Uh oh!

Contributors

Uh oh!

Languages

Folders and files

Latest commit

History

Repository files navigation

extractText

Parsers used:

Installation

Usage

About

Resources

License

Uh oh!

Stars

Watchers

Forks

Releases

Packages 0

Uh oh!

Uh oh!

Contributors

Uh oh!

Languages

Packages