ParseJet

PDF OCR — Taranmış PDF'ler İçin Metin Tanıma

Taranmış PDF sadece sayfa resimleridir: arayamazsınız, metin seçemezsiniz veya kopyalayamazsınız. ParseJet'in PDF OCR'ı her görüntü tabanlı sayfayı işler, metin tanımasını kendi sunucularında çalıştırır ve belgeyi arayabileceğiniz, kopyalayabileceğiniz ve yeniden kullanabileceğiniz metin olarak döndürür. Zaten metin katmanı olan sayfalar olduğu gibi çıkarılır, böylece karma belgeler tamamlanır.

Bir dosyayı buraya bırakın veya göz atın

PDF dosyalarını kabul eder

Ücretsiz — günde 3 istek, kayıt gerekmez. ayda 300 kredi ücretsiz için.

Nasıl çalışır

1

Taranmış PDF yükleyin

Dosyayı yukarıya bırakın — tarayıcıdan, telefon tarama uygulamasından veya faksdan. Metin katmanı olan dijital PDF'ler de çalışır.

2

Metin tanıma, sayfa sayfa

ParseJet her sayfayı kontrol eder. Gerçek metne sahip sayfalar doğrudan okunur; sadece görüntü sayfaları işlenir ve OCR'dan geçer.

3

Metni kopyalayın

Tüm belgeyi kopyalayın veya arama, elektronik tablolar veya LLM'yi beslemek için API aracılığıyla Markdown veya düz metin olarak getirin.

Temel özellikler

Bu pdf ocr aracını öne çıkaran özellikler.

OCR'a hangi sayfaların ihtiyacı olduğunu algılar

Yapılandırılacak bir şey yoktur. Birkaç düzine çıkarılabilir karakterden daha az olan bir sayfa tarama olarak kabul edilir ve tanınır; diğer sayfalar orijinal metinlerini tutar.

20+ dil

Latin yazı dilleri, Basitleştirilmiş ve Geleneksel Çince ve Japonca ayarlanmaya gerek kalmadan. Korece, Kiril, Arapça, Hintçe, Tayca ve Yunanca taramalar bir dil ipucu ile çalışır.

Karma belgeler işlenir

Taranmış imza sayfasına sahip sözleşmeler, taranmış eklerin bulunduğu raporlar — metin, tanınan sayfaların eklenmesiyle sayfa sırasında döndürülür.

Hiçbir şey sunucularımızdan çıkmaz

Sayfalar, ParseJet'in kendi altyapısında açık kaynak modelleri kullanılarak işlenir ve tanınır; üçüncü taraf AI hizmeti belgenizi görmez.

Markdown veya düz metin

Dijital sayfalardan başlıkları ve tabloları tutmak için output_format=markdown isteyin veya düz metin için raw isteyin.

İstek başına 30'a kadar taranmış sayfa

Çoğu mektup, form ve rapor için yeterlidir. Daha uzun taramalar: dosyayı bölün veya API aracılığıyla toplu işlemle işleyin.

Kullanım senaryoları

Bu aracın size zaman kazandırdığı yaygın senaryolar.

Arşivlenen sözleşmeler ve faturalar

Yılların taranmış evraklarını aranabilir hale getirin — metni bir kez çıkarın ve indeksleyin.

Telefon taranan belgeler

Tarama uygulamaları görüntü tabanlı PDF'ler kaydeder. OCR aracılığıyla çalıştırın, bir adresi, bir paragrafı veya toplamı kopyalayın.

Eski kitaplar ve raporlar

Taranmış sayfaları alıntılamak, çevirmek veya erişilebilirlik araçları için metne dönüştürün.

Taramaları AI'ye besleme

Claude ve ChatGPT bir sayfanın resmini güvenilir bir şekilde okuyamaz. Önce OCR'ı çalıştırın, ardından metni yapıştırın veya boru atın.

API ile otomatikleştirin

Aynı aracı programatik olarak kullanın. Herhangi bir dil ile çalışır — sadece HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

Bunu otomatikleştirmek mi istiyorsunuz?

ParseJet API, aynı ayrıştırma gücünü tek bir HTTP endpoint'i ile sunar. ffmpeg yok, poppler yok, tesseract yok — sadece bir API çağrısı.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
API Dokümanlarını Okuyun

Sıkça sorulan sorular

PDF'yi nasıl OCR yaparım?

PDF'i yukarıya yükleyin. ParseJet her sayfaya bakar, sadece görüntü olanları tanır ve tam metni gösterir — tipik mektup veya form için genellikle birkaç saniye içinde. Kopyalayın veya birçok dosya için aynısını yapmak üzere API'yi çağırın.

PDF'min OCR'a ihtiyacı olup olmadığını nasıl bilebilirim?

Açın ve bir kelime seçmeyi deneyin. Hiçbir şey vurgulanmaz veya yakınlaştırma harfleri fotoğraf gibi pikselli görünürse, sayfa bir görüntüdür ve OCR'a ihtiyaç duyar. Tarayıcılardan, faks makinelerinden ve telefon tarama uygulamalarından gelen PDF'ler neredeyse her zaman böyledir.

Geri aranabilir bir PDF alır mıyım?

Metni alırsınız, yeni bir PDF dosyasını değil. Bu, kopyalama, arama, indeksleme, çevirme veya AI modelini beslemek için ihtiyacınız olan şeydir. Özellikle orijinal PDF'ye görünmez bir metin katmanı eklemeniz gerekiyorsa, OCRmyPDF gibi bir masaüstü aracı bunu yapabilir.

Sayfa sınırı var mı?

İstek başına 30'a kadar taranmış sayfa tanınır; zaten metin içeren sayfalar sayılmaz. Daha uzun taramalar için dosyayı bölün veya API aracılığıyla parça parça gönderin. Yanıt meta verisi, tanınan sayfaları ve atlanmış olanları listeler.

Hangi diller desteklenir?

İngilizce ve tüm Latin yazı dili, Basitleştirilmiş ve Geleneksel Çince ve Japonca otomatik olarak çalışır. Korece, Rusça ve diğer Kiril dilleri, Arapça, Hintçe, Tayca veya Yunanca için language=ko, ru, ar, hi, th veya el iletin (bu sayfanın yerelleştirilmiş versiyonları sizin için yapar).

Ücretsiz mi?

Evet. Kayıt olmadan günde 3 ücretsiz dönüştürme, ücretsiz hesapla ayda 300 kredi ve daha büyük dosyalar ve daha yüksek kotalar için 19$/aydan ücretli planlar.

Ücretsiz metin çıkarmaya başlayın

Kayıt gerekmez. İlk dosyanızı saniyeler içinde ayrıştırın.