Tủ GitHub repo xịn
Avatar baidu

GitHub repo xịn · Vui Coding chọn

baidu/Unlimited-OCR

Unlimited OCR Works là dự án mã nguồn mở giúp phân tích và trích xuất thông tin từ các tài liệu hình ảnh hoặc PDF, hỗ trợ xử lý đa trang, đa định dạng. Dự án hữu ích trong tự động hoá xử lý tài liệu lớn, nâng cao hiệu suất và chính xác trong các ứng dụng OCR phức tạp.

25 NGitHub stars
2,6 NForks
78Open issues
0Lượt nhấp GitHub
PythonNgôn ngữ chính

Tóm tắt nhanh

Repo này làm được gì?

Unlimited OCR Works là dự án mã nguồn mở giúp phân tích và trích xuất thông tin từ các tài liệu hình ảnh hoặc PDF, hỗ trợ xử lý đa trang, đa định dạng. Dự án hữu ích trong tự động hoá xử lý tài liệu lớn, nâng cao hiệu suất và chính xác trong các ứng dụng OCR phức tạp.

Mô tả từ GitHub

Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.

Bắt đầu với repo

Cài đặt và sử dụng

Hướng dẫn cài đặt

1. Cài đặt các yêu cầu cần thiết:

pip install torch==2.10.0 torchvision==0.25.0 transformers==4.57.1 Pillow==12.1.1 matplotlib==3.10.8 einops==0.8.2 addict==2.4.0 easydict==1.13 pymupdf==1.27.2.2 psutil==7.2.2

2. Cài đặt model: Dùng pip hoặc bằng cách tải về từ Hugging Face, tích hợp vào mã của bạn. 3. Tải mã nguồn từ repository và sử dụng theo hướng dẫn của mã mẫu trong README.

Hướng dẫn sử dụng

1. Tải và chuẩn bị mô hình:

import os
import torch
from transformers import AutoModel, AutoTokenizer

model_name = 'baidu/Unlimited-OCR'
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModel.from_pretrained(
    model_name,
    trust_remote_code=True,
    use_safetensors=True,
    torch_dtype=torch.bfloat16,
)
model = model.eval().cuda()

2. Phân tích một hình ảnh đơn:

model.infer(
    tokenizer,
    prompt='document parsing.',
    image_file='your_image.jpg',
    output_path='your/output/dir',
    base_size=1024, image_size=640, crop_mode=True,
    max_length=32768,
    no_repeat_ngram_size=35, ngram_window=128,
    save_results=True,
)

3. Phân tích đa trang hoặc PDF:

model.infer_multi(
    tokenizer,
    prompt='Multi page parsing.',
    image_files=['page1.png', 'page2.png'],
    output_path='your/output/dir',
    image_size=1024,
    max_length=32768,
    no_repeat_ngram_size=35, ngram_window=1024,
    save_results=True,
)

Các bước trên là cấu hình cơ bản để sử dụng dự án OCR này.

Đối chiếu README gốc
Mở trên GitHub

Cùng hệ sinh thái

Repo liên quan