PDF'den Tablo Nasıl Çıkarılır
Bir PDF'deki tabloyu kopyalayıp Excel'e yapıştırdığınızda genellikle karışmış değerlerden oluşan tek bir uzun sütun elde edersiniz — ya da hiçbir şey. Bu sizin hatanız değil: PDF'ler aslında tablo saklamaz. Bu kılavuz, hızlı kopyala-yapıştır hilelerinden taranmış belgeleri işleyebilen araçlara kadar işe yarayan 4 yöntemi karşılaştırır; böylece dosyanız için doğru olanı seçebilirsiniz.
PDF tablolarını çıkarmak neden bu kadar zor?
Bir PDF'de tablo kavramı yoktur. Satır ve sütun gibi görünen şey, aslında x/y koordinatlarına yerleştirilmiş tek tek metin parçalarıdır; bazen aralarına çizgiler çizilmiştir. "Tablo" yalnızca sizin gözünüzde vardır — dosyada hücre, satır veya başlık saklanmaz.
Bu yüzden her çıkarma yöntemi aslında bir yeniden inşadır: bir algoritma hangi metin parçalarının aynı hücreye ait olduğunu, hangi hücrelerin bir satır oluşturduğunu ve sütunların nerede başladığını tahmin eder. Çizgili tablolar (görünür kılavuz çizgileri olanlar) daha kolay yeniden kurulur; boşlukla ayrılmış tablolar, birleştirilmiş hücreler, çok satırlı hücreler ve birden çok sayfaya yayılan tablolar çoğu aracın başarısız olduğu yerlerdir.
Taranmış PDF'ler işe bir katman daha ekler: sayfa bir fotoğraftır, dolayısıyla OCR çalışana kadar ortada hiç metin yoktur. Yönteminizi, belgenizin bu sorunlardan hangisine sahip olduğuna göre seçin.
Yöntem 1: Excel'e kopyala-yapıştır (hızlı, küçük çizgili tablolar)
Basit, düzgün çizgili bir tablo için tabloyu PDF görüntüleyicinizde seçin, kopyalayın ve Excel'e veya Google Sheets'e yapıştırın. Her şey tek sütuna düşerse değerleri yeniden bölmek için Veri → Metni Sütunlara Dönüştür (Excel) veya Veri → Metni sütunlara böl (Sheets) yolunu kullanın.
İşe yarayan bir varyasyon: hangi yapının hayatta kaldığını görmek için önce düz metin düzenleyicisine yapıştırın. Değerler tutarlı boşluklarla veya sekmelerle ayrılmışsa Metni Sütunlara Dönüştür tabloyu kurtarır; satırlar iç içe geçmiş veya kesilmişse hiçbir bölme işlemi bunu düzeltemez.
Ne zaman işe yarar: kısa hücre değerlerine sahip tek sayfalık çizgili tablolar. Ne zaman başarısız olur: birleştirilmiş hücreler, hücre içindeki çok satırlı metinler, binlik ayırıcılı sayıların parçalanması ve her türlü taranmış belge.
Yöntem 2: Excel Power Query veya Word (yerleşik, ek araç yok)
Modern Excel, PDF tablolarını doğrudan içe aktarabilir: Veri → Veri Al → Dosyadan → PDF'den. Excel belgeyi tarar, algıladığı her tabloyu listeler ve bir önizleme gösterir — tabloyu seçip Yükle'ye tıklayın, tablo düzgün bir elektronik tablo aralığı olarak yerleşir. Windows'ta en iyi yerleşik seçenek budur (Microsoft 365 veya 2021+ lisansı gerektirir ve Mac için Excel'in her sürümünde bulunmaz).
Word de PDF'leri doğrudan açabilir (Dosya → Aç → PDF'yi seçin). Belgeyi düzenlenebilir bir dosyaya dönüştürür ve basit tablolar genellikle Excel'e kopyalayabileceğiniz gerçek Word tabloları olarak hayatta kalır.
Ne zaman işe yarar: net çizgili tablolara sahip, dijital olarak oluşturulmuş PDF'ler. Ne zaman başarısız olur: yalnızca boşlukla ayrılmış tablolar sıklıkla atlanır veya yanlış bölünür, çok sayfalı tablolar ayrı parçalar halinde içe aktarılır ve taranmış PDF'ler hiçbir sonuç üretmez — Power Query OCR yapmaz.
Yöntem 3: Python kütüphaneleri — camelot, tabula-py, pdfplumber (geliştiriciler)
Çok sayıda PDF'den programatik olarak tablo çıkarmanız gerekiyorsa yerleşik açık kaynak seçenekleri şunlardır: camelot (çizgili tablolarda en iyisi, iki algılama modu), tabula-py (Java tabanlı Tabula motorunun sarmalayıcısı, tutarlı düzenlerde sağlam) ve pdfplumber (kelimeler, çizgiler ve dikdörtgenler üzerinde düşük seviyeli kontrol — özel mantık gerektiğinde en iyisi).
Minimal bir camelot örneği: pip install camelot-py[cv], ardından tables = camelot.read_pdf("report.pdf", pages="all") ve tables[0].df size bir pandas DataFrame verir. .to_csv() veya .to_excel() ile dışa aktarın.
İşin püf noktası: her kütüphanenin tercih ettiği bir düzen stili vardır ve gerçek dünya belgeleri stilleri karıştırır. Ayarları belge ailesi başına ince ayarlamayı bekleyin (camelot'ta flavor="stream" ile "lattice", tabula'da alan ipuçları) ve hiçbiri taranmış PDF'leri işleyemez — önce OCR çalıştırmanız gerekir ve bu süreçte düzeni kaybedersiniz.
Tabloların ötesinde Python ile PDF ayrıştırmaya daha geniş bir bakış için Python'da PDF'yi Markdown'a dönüştürme kılavuzumuza bakın.
Yöntem 4: AI destekli çıkarma (taranmış PDF'ler, karışık düzenler, ölçek)
En yeni yaklaşım, sayfayı bir insanın okuduğu gibi okuyan belge anlama modellerini kullanır — tablo yapısını çizgilere veya koordinat sezgilerine dayanmak yerine görsel düzenden algılar. Taranmış belgeleri, fotoğraflanmış sayfaları ve tutarsız düzenleri tek seferde işleyebilen tek yöntem sınıfı budur.
ParseJet bu şekilde çalışır: parsejet.com/tools/pdf-to-markdown adresinden bir PDF yükleyin, tablolar okuma sırasına göre temiz Markdown tabloları olarak geri gelir — taranmış sayfalar otomatik olarak OCR ile işlenir. Metin yerine veri istiyorsanız API, ayrıştırılan belgeyi yapılandırılmış çıktı olarak döndürür (PDF'den JSON'a aracına bakın) ve dosya başına tek POST isteği, toplu işlem hatları için pratik bir çözüm sunar.
Ne zaman işe yarar: taranmış ve fotoğraflanmış belgeler, karışık çizgili/boşluklu düzenler ve belge başına ince ayarın imkansız olduğu toplu işlemler. Ödünleşim: barındırılan bir hizmettir — temiz bir PDF'deki tek seferlik bir tablo için Yöntem 1 veya 2 daha hızlıdır.
Hangi yöntemi kullanmalısınız?
Tek seferlik, küçük ve çizgili bir tablo: kopyala-yapıştır (Yöntem 1); yapıştırma karışırsa Excel Power Query'ye (Yöntem 2) geçin.
Aynı düzene sahip yinelenen raporlar: elektronik tablo kullanıcıları için Power Query, geliştiriciler için camelot veya tabula-py (Yöntem 3) — tek seferlik kurulum, gelecekteki her dosyada kendini amorti eder.
Taranmış belgeler, fotoğraflar veya dağınık karışık düzenler: AI ile çıkarma (Yöntem 4), yeniden yazmayı gerektirmeyen gerçekçi tek seçenektir.
Değişken düzenlere sahip yüzlerce belge: API üzerinden Yöntem 4 — Yöntem 3 kütüphanelerinin belge başına ince ayarı, birkaç düzen ailesinin ötesine ölçeklenmez.
Her PDF'den tablo çıkarın — taramalar dahil
Bir PDF yükleyin ve her tabloyu okuma sırasına göre temiz Markdown olarak geri alın; taranmış sayfalar otomatik olarak OCR ile işlenir. Ücretsiz deneyin, kayıt gerekmez.
PDF'den Markdown'a Aracını DeneyinSıkça sorulan sorular
PDF'deki bir tabloyu Excel'e nasıl aktarırım?
Önce Excel'in yerleşik içe aktarıcısını deneyin: Veri → Veri Al → Dosyadan → PDF'den, ardından algılanan tabloyu seçin. Excel tabloyu atlar veya bozarsa — boşlukla ayrılmış veya taranmış tablolarda yaygındır — ParseJet gibi bir AI aracıyla çıkarıp Markdown tablosunu Excel'e yapıştırın.
Taranmış bir PDF'den tablo çıkarabilir miyim?
Yalnızca OCR yapabilen araçlarla. Kopyala-yapıştır, Power Query ve Python tablo kütüphanelerinin tümü gerçek metin gerektirir. AI destekli çıkarıcılar önce sayfayı OCR ile işler, sonra tabloyu yeniden kurar — taramayı ParseJet'e yükleyin, tablo metin olarak geri gelir.
PDF tablo çıkarma için en iyi Python kütüphanesi hangisi?
Çizgili tablolar için camelot, tutarlı rapor düzenleri için tabula-py, özel düşük seviyeli mantık gerektiğinde pdfplumber. Üçü de düzen başına ince ayar ister ve hiçbiri taranmış sayfaları işleyemez; bu yüzden dağınık girdili işlem hatları genellikle bir ayrıştırma API'sini çağırmaya yönelir.
Yapıştırdığım tablo neden tek sütuna düşüyor?
PDF görüntüleyiciniz tablo satır parçalarını boşluklarla ayrılmış düz satırlar olarak serileştirdi ve Excel her satırı tek hücreye yapıştırdı. Yeniden bölmek için Metni Sütunlara Dönüştür'ü kullanın ya da tablo yapısını yeniden kuran bir yönteme (Power Query veya bir çıkarma aracı) geçin.
Birleştirilmiş hücreli tablolar nasıl çıkar?
Çoğu araçta kötü — birleştirilmiş hücreler, her sezgisel yöntemin dayandığı satır/sütun ızgarasını bozar. Yapıyı anlayan çıkarma en iyi sonucu verir; hangi yöntemi kullanırsanız kullanın, birleştirilmiş bölgeleri elle doğrulamayı bekleyin.
Çok sayıda PDF'den tabloları otomatik olarak çıkarabilir miyim?
Evet — her dosyayı bir ayrıştırma API'sine POST edin. ParseJet'te /v1/parse/auto/file, belgeyi tabloları Markdown (veya yapılandırılmış JSON) olarak içerecek şekilde döndürür ve ücretsiz API hesabı ayda 300 kredi içerir.
İlgili araçlar
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
PDF to JSON Converter
Convert PDF to JSON online for free. Get text, title, and metadata as structured JSON — ready for your app, database, or AI pipeline. API included.
Extract Text from PDF
Extract text from PDF files online for free. Supports scanned documents, multi-page PDFs, and complex layouts. No installation needed — works in your browser.
Related guides
How to Convert PDF to Markdown in Python
Convert PDF to Markdown in Python: PyMuPDF4LLM, Marker, MarkItDown, and a hosted API compared — with working code, accuracy notes, and when to pick each.
How to Copy Text from a PDF
Learn 4 proven ways to copy text from any PDF file — regular, scanned, or protected. Includes free methods, step-by-step instructions, and troubleshooting tips.
Ücretsiz metin çıkarmaya başlayın
Kayıt gerekmez. İlk dosyanızı saniyeler içinde ayrıştırın.