SEO

PDF SEO: Ranken PDFs bei Google und wie entfernen Sie sie?

Talha Aslan 17 Minuten Lesezeit 2 Aufrufe

Was ist PDF SEO, und ranken PDFs bei Google?

Ja, PDFs können bei Google indexiert werden und in den Suchergebnissen ranken. PDF SEO bedeutet, dass Sie diese Dateien mit klarem Titel, lesbarem Text und passenden Signalen zur richtigen Seite in den Index bringen. Google zählt das Adobe PDF Format offiziell zu den indexierbaren Dateitypen.

Dieser Ratgeber beantwortet genau eine Frage: Wie verhalten sich Ihre PDFs bei Google, und wie steuern Sie dieses Verhalten? Allgemeine SEO Theorie lassen wir weg und verlinken stattdessen auf unsere anderen Beiträge. Die offizielle Quelle ist die Google Seite zu den indexierbaren Dateitypen.

Hinweis: Wir schreiben ein Google Verhalten nur dann als Fakt, wenn wir es in der offiziellen Dokumentation prüfen konnten. Wo das nicht ging, sagen wir offen, dass wir keine klare Aussage in den offiziellen Dokumenten gefunden haben.

Welche Dateitypen indexiert Google, und gehört PDF dazu?

Die offizielle Google Dokumentation gruppiert die unterstützten Dateitypen. Das Adobe Portable Document Format steht in der Gruppe der codierten Dateien. Das sind also Binärdateien oder Container, für die Google einen eigenen Parser braucht, um lesbaren Text zu gewinnen.

Dieselbe Seite sagt, dass Google den Dateityp vor allem am Inhaltstyp Header erkennt, den der Server liefert. Fehlt dieser Header oder ist er falsch, nutzt Google unter Umständen die Dateiendung. Außerdem kann Google die Datei mit einem anderen Parser neu lesen. Daher sollte Ihr Server jedes PDF mit dem richtigen Typ ausliefern.

Welche PDFs Ihrer Domain Google zeigt, sehen Sie mit einer Suche wie "site:example.com filetype:pdf". Laut Google Dokumentation schränkt der Operator filetype die Ergebnisse auf einen Dateityp ein. Die Trefferzahl ist nur ein grober Hinweis. Trotzdem zeigt ein unerwartetes PDF in der Liste, dass Sie aufräumen müssen, zum Beispiel bei einer alten Preisliste oder einem internen Formular.

Was ist der Unterschied zwischen einem Text PDF und einem gescannten Bild PDF?

Ein Text PDF enthält eine echte Textebene. Sie markieren einen Satz mit der Maus und kopieren ihn. Ein gescanntes Bild PDF speichert dagegen ein Foto jeder Seite, das heißt nur Pixel. Auf dem Bildschirm wirkt es wie Text, doch in der Datei liegen nur Pixel.

Im offiziellen Google Blogbeitrag zu PDFs erklärt Google, dass es Bilder per OCR verarbeiten kann, wenn Text als Bild eingebettet ist. Der Beitrag nennt außerdem eine praktische Regel: Können Sie Text aus einem PDF kopieren und in ein einfaches Textdokument einfügen, sollte Google diesen Text indexieren können. Diese Aussage fanden wir nicht wörtlich in den aktuellen Hilfeseiten. Lesen Sie sie also als Grundsatz und nicht als Garantie.

Unser Rat aus der Praxis ist einfach: Veröffentlichen Sie PDFs möglichst mit Textebene. Denn das OCR Ergebnis kann fehlerhaft oder unvollständig sein. Zudem haben Leser mit Hilfsmitteln dann Probleme.

Der Test der Textebene ist der erste Schritt jeder PDF SEO Prüfung. Sie brauchen dafür keine Spezialsoftware, also machen Sie diese drei schnellen Prüfungen bei jedem neuen PDF.

  1. Öffnen Sie das PDF im Browser und markieren Sie einen Absatz mit der Maus. Gelingt das nicht, ist die Datei vermutlich ein Bild.
  2. Fügen Sie den markierten Text in einen einfachen Texteditor ein. Defekte Buchstaben oder seltsame Leerzeichen deuten auf eine fehlerhafte Textebene hin.
  3. Suchen Sie im PDF nach einem Wort. Findet die Suche nichts, fehlt die Textebene oder sie ist unvollständig.

Fällt ein Test durch, exportieren Sie die Datei erneut aus dem Quelldokument, etwa aus der Textverarbeitung oder der Designdatei. Ist ein Scan Ihre einzige Option, starten Sie die Texterkennung und lesen das Ergebnis von Hand nach. Außerdem bieten Sie denselben Inhalt als HTML Seite an, denn das ist die robusteste Lösung.

Wie bestimmt Google den Titel eines PDFs?

Der offizielle Google Blogbeitrag zu PDFs nennt zwei Signale für den Titel in den Suchergebnissen: den Titel in den Metadaten der Datei und den Ankertext der Links, die auf das PDF zeigen. Google empfiehlt, beides zu pflegen, damit die Systeme ein starkes Signal bekommen.

Dazu eine ehrliche Einschränkung. Die Google Dokumentation zu Titellinks von HTML Seiten erwähnt PDFs nicht. Deshalb fanden wir keinen offiziellen Text, der den kompletten Titelalgorithmus für PDFs beschreibt. Google kann zudem einen anderen Titel wählen als den, den Sie festlegen. Für HTML Seiten sagt die Dokumentation das ausdrücklich.

Das praktische Fazit ist kurz: Tragen Sie den Dokumenttitel ein, schreiben Sie beschreibende Linktexte für jeden Link auf die Datei und prüfen Sie dann, wie der Titel in den Suchergebnissen erscheint.

Wie pflegen Sie die Metadaten für bessere PDF SEO?

Bei PDF SEO geht es bei den Metadaten um Titel, Autor, Thema und Stichwörter in den Dateieigenschaften. Die meisten Design und Office Programme erlauben das Ausfüllen beim Export. Menünamen unterscheiden sich je nach Programm, daher nennen wir hier keine genauen Schaltflächen. Suchen Sie den Bereich zu den Dokumenteigenschaften.

Lassen Sie den Titel nie leer, denn sonst übernimmt das Programm eventuell den Dateinamen oder einen alten Entwurfsnamen als Titel. Ein Titel wie "Neues Dokument Final v3" hinterlässt in den Suchergebnissen einen schlechten ersten Eindruck.

Halten Sie den Titel daher kurz und stellen Sie das Thema nach vorn, zum Beispiel "Checkliste Lieferantenauswahl". Den Markennamen setzen Sie ans Ende.

Prüfen Sie außerdem die Felder für Autor und Thema. Stellen Sie zum Beispiel sicher, dass dort keine Personennamen, internen Projektcodes oder vertraulichen Notizen stehen. Googles Hinweise zu geschwärzten Informationen warnen, dass versteckte Metadaten die Namen von Personen enthalten können, die eine Datei bearbeitet haben.

Die Metadaten von Bildern sind allerdings ein eigenes Thema, das wir im Beitrag zu IPTC Bildmetadaten in Google Bilder behandeln.

Warum konkurrieren PDFs bei PDF SEO mit Ihren HTML Seiten?

Veröffentlichen Sie denselben Inhalt als PDF und als HTML Seite, können beide für dieselbe Suchanfrage in Frage kommen. Anders gesagt konkurrieren Sie mit sich selbst. Manchmal gewinnt das PDF, und der Besucher landet auf einer nackten Datei ohne Menü, Formular und Conversion Weg.

Das ist ein typisches PDF SEO Problem. Es ist keine Strafe. Vielmehr verteilen sich die Signale, ähnlich wie bei doppeltem Inhalt. Die echte SEO Wirkung von Duplikaten erklären wir im Beitrag zu Duplicate Content, deshalb wiederholen wir sie hier nicht.

Die Lösung ist meist dieselbe. Entscheiden Sie zunächst, welche Version Nutzer sehen sollen. Senden Sie dann Signale, die diese Version bevorzugen. Für die meisten Unternehmen ist das die HTML Seite, denn sie hat Navigation, interne Links, Messung und einen Conversion Bereich.

Sollte das PDF oder die HTML Seite die kanonische Version sein?

In der Regel sollte die Version kanonisch sein, die für Ihr Unternehmen Wert schafft. Das ist meist die HTML Seite. Das PDF bleibt dann eine herunterladbare Kopie.

Es gibt allerdings Ausnahmen. Existiert eine technische Spezifikation nur als PDF, ist sie die einzige Version und braucht kein Canonical Signal. Ebenso kann neben einer kurzen HTML Zusammenfassung ein eigener, ausführlicher PDF Bericht stehen. Unterscheiden sich die Inhalte wirklich, können beide für sich stehen.

Stellen Sie sich eine Frage: Soll ein Suchender auf dem PDF oder auf der Seite landen? Lautet die Antwort Seite, sollte das Canonical Signal des PDFs auf diese Seite zeigen. Treffen Sie die Entscheidung einmal und wenden Sie sie auf alle PDFs an. Beginnen Sie dann mit den Dateien, die die meisten Links und Suchen bekommen. Eine kleine Inventartabelle hilft dabei sehr.

Zur Auffrischung lesen Sie unseren Beitrag zum Canonical Tag.

Was bewirkt ein Canonical HTTP Header bei PDFs, und was garantiert er nicht?

In ein PDF können Sie kein HTML Tag setzen. Daher reist das Canonical Signal in einem HTTP Header, den der Server mit der PDF Antwort sendet. Die Google Dokumentation zum Zusammenführen doppelter URLs unterstützt das: Veröffentlichen Sie Inhalte in mehreren Formaten, etwa PDF oder Word, jeweils unter eigener URL, können Sie die kanonische URL per HTTP Header nennen.

Dieselbe Seite nennt zwei Grenzen. Google unterstützt die Methode nur für die Websuche. Außerdem zeigt das Beispiel eine Word Datei, die auf ihre PDF Version verweist. Dieselbe Logik gilt, wenn ein PDF auf eine HTML Seite verweist. Trotzdem ist ein Canonical ein Hinweis und kein Befehl, und Google trifft die letzte Entscheidung.

Den Header einzurichten erfordert eine Servereinstellung. Wir zeigen hier keinen Code. Fragen Sie Ihren Entwickler oder Serveradministrator, ob sich Canonical Header an PDF Antworten anhängen lassen. Wie Sie Canonical Probleme überwachen, lesen Sie im Beitrag zu Canonical Fehlern in der Search Console.

PDF oder HTML Seite: Was passt bei PDF SEO wann besser?

Die folgende Tabelle vergleicht beide Formate aus SEO und Nutzersicht. Sie ist eine allgemeine Einschätzung aus unserer Erfahrung, und jedes Unternehmen liegt anders.

KriteriumHTML SeitePDF
---------
Menü und interne LinksVorhandenNicht vorhanden
Messung und Conversion BereichLeicht aufzubauenEingeschränkt
Lesbarkeit auf dem SmartphoneMeist gutJe nach Gerät unterschiedlich
Drucken und Offline AblageSchwachStark
Aufwand für TextänderungenGeringDatei muss neu erstellt werden
TitelsteuerungSeitentitelDateimetadaten und Linktext
Canonical SignalInnerhalb der SeiteHTTP Header

Setzen Sie mit dieser Tabelle Ihre Prioritäten. Kurz gesagt: Inhalte, die gelesen werden und konvertieren sollen, gehören auf eine HTML Seite. Inhalte, die Leser drucken, unterschreiben oder archivieren, bieten Sie als PDF an und verlinken sie von der HTML Seite aus.

Was tun Sie zuerst, wenn ein unerwünschtes PDF bei Google auftaucht?

Bleiben Sie zunächst ruhig und trennen Sie die Ursache. Entweder soll das PDF nur nicht ranken, oder es enthält Informationen, die nicht öffentlich sein dürfen. Der zweite Fall ist dringender.

  1. Prüfen Sie, ob das PDF wirklich indexiert ist. Suchen Sie bei Google nach "site:example.com filetype:pdf".
  2. Prüfen Sie die Datei auf private oder vertrauliche Daten. Finden Sie welche, nehmen Sie die Datei zuerst vom Server und lesen den Abschnitt zu sensiblen Informationen weiter unten.
  3. Bleibt die Datei online, wählen Sie eine Regel, die sie aus dem Index hält: eine Noindex Regel im HTTP Header oder das Löschen.
  4. Sperren Sie die Datei nicht in der robots.txt. Warum, erklären die nächsten Abschnitte.
  5. Warten Sie, bis Google die Änderung verarbeitet hat, und prüfen Sie erneut.

Notieren Sie außerdem das Ergebnis jedes Schritts, damit Sie wissen, welche Änderung gewirkt hat. Keine Methode liefert sofort ein Ergebnis, denn Google muss die Datei erneut abrufen.

Wie entfernen Sie ein PDF mit X-Robots-Tag aus dem Index?

Da Sie kein Noindex Tag in ein PDF setzen können, empfiehlt Google den HTTP Antwort Header X-Robots-Tag. Die Google Dokumentation zum Robots Meta Tag rät, damit Ressourcen ohne HTML, etwa PDFs, Videos und Bilder, vom Index fernzuhalten.

Die Logik ist einfach: Zunächst sendet der Server das PDF und hängt an die Antwort eine Noindex Regel an. Google ruft die Datei ab, liest den Header und nimmt die Datei aus dem Index. Sie können die Regel zum Beispiel auf einzelne Dateien oder auf alle PDFs anwenden. Die genaue Einrichtung hängt von Ihrer Serversoftware ab.

Dieselbe Dokumentation beschreibt auch eine Regel "unavailable_after", die eine Ressource nach einem bestimmten Datum nicht mehr zeigt. Das kann zu kurzlebigen Aktionskatalogen passen. Prüfen Sie die Details dieser Regel allerdings in der offiziellen Robots Dokumentation.

Das Noindex Konzept selbst erklären wir im Beitrag zum Status durch Noindex Tag ausgeschlossen, deshalb wiederholen wir es nicht.

Entfernt die robots.txt ein PDF aus dem Google Index?

Meist nicht, denn die robots.txt sperrt das Crawling und nicht die Indexierung. Erfährt Google die URL über Links auf anderen Seiten, kann es die Adresse im Index behalten, obwohl es den Inhalt nicht lesen kann.

Es gibt eine größere Falle. Damit eine Noindex Regel wirkt, muss Google die Datei abrufen können. Sperrt die robots.txt das PDF, sieht Google den X-Robots-Tag Header nie. Das Sperren und das Setzen eines Noindex Headers zugleich widersprechen sich also.

Die richtige Reihenfolge lautet so. Erstens halten Sie das PDF abrufbar. Zweitens setzen Sie den Noindex Header. Drittens warten Sie, bis Google die Datei entfernt. Danach können Sie bei Bedarf eine robots.txt Regel ergänzen. Den Unterschied der Werkzeuge zeigt unser Vergleich von Noindex, Nofollow und robots.txt.

Wie entfernen Sie ein PDF mit sensiblen Informationen aus Google?

Dieser Abschnitt ist keine Rechtsberatung. Enthält eine Datei personenbezogene Daten, sprechen Sie mit Ihrer Rechtsberatung. Technisch empfiehlt die Google Seite zum Fernhalten geschwärzter Informationen vier Schritte.

  1. Nehmen Sie das Live Dokument von dem Ort, an dem Sie es veröffentlicht haben.
  2. Nutzen Sie bei einer verifizierten Website das Removals tool in der Search Console, um die URLs aus der Suche zu entfernen.
  3. Veröffentlichen Sie das korrekt geschwärzte Dokument unter einer anderen URL.
  4. Liegen Kopien auf fremden Websites, bitten Sie die Betreiber um Entfernung.

Das Removals tool ist nur eine vorübergehende Maßnahme. Daher ist die dauerhafte Lösung ist, die Datei vom Server zu löschen oder den Zugriff zu schließen. Dieselbe Seite warnt außerdem, dass Formate wie PDF Änderungsverläufe und unsichtbare Metadaten behalten können. Unter einer geschwärzten Fläche kann also noch der alte Text liegen. Exportieren Sie das Dokument deshalb neu aus einer sauberen Quelle.

Helfen Links innerhalb eines PDFs bei SEO?

Links im PDF helfen dem Leser. Sie führen zur passenden Seite, zum Formular oder zum Preisbereich. Zur SEO Wirkung dagegen fanden wir in den offiziellen Google Dokumenten keine klare Aussage dazu, wie Links in PDFs behandelt werden. Deshalb stellen wir keine feste Behauptung auf.

Das ist unser sicherer Ansatz: Setzen Sie vollständige, beschreibende Links in das PDF. Der Linktext soll stattdessen das Ziel nennen und nicht "hier klicken" lauten. So verstehen Leser und die Systeme, die die Datei auslesen, wohin der Link führt.

Denken Sie auch an die Messung. Klickt jemand auf einen Link im PDF, übernimmt Ihre eigene Seite mit ihrer Analyse. Sie können an die Zieladresse UTM Parameter anhängen. Unser UTM Generator hilft Ihnen, sie einheitlich zu erstellen.

Warum ist der Linktext auf ein PDF wichtig?

Eines der Titelsignale ist der Ankertext der Links, die auf das PDF zeigen. Schreiben Sie auf Ihrer Website "Bericht", "Download" oder "Hier klicken", sagen Sie Google wenig über die Datei. Eine Formulierung wie "Checkliste Lieferantenauswahl (PDF)" gibt Menschen und Suchmaschinen klare Informationen.

Prüfen Sie daher jeden internen Link auf jedes PDF. Verlinken Menüs, Blogbeiträge und Produktseiten dieselbe Datei mit unterschiedlichem Text, vereinheitlichen Sie ihn. Details finden Sie in unserem Beitrag zum Ankertext.

Sagen Sie Nutzern außerdem, wenn ein Link eine Datei öffnet. Ergänzen Sie "(PDF)" im Text und, wenn möglich, die Dateigröße. Niemand mag einen unerwarteten Download.

Wie benennen Sie PDF und URL, und sollten Aktions PDFs die Adresse behalten?

Die Adresse ist der erste Eindruck einer Datei, daher lohnt sich ein Blick darauf. Ein Name wie "scan0042final2.pdf" sagt nichts, während ein sprechender Dateiname das Thema nennt. Kleinbuchstaben und Bindestriche in der Adresse sind eine sichere Wahl.

Vermeiden Sie deshalb Jahreszahlen, Versionsnummern oder das Wort "final" in der Adresse. Ändern Sie die Adresse nämlich bei jedem Update, riskieren Sie, den Linkverlauf und den Indexeintrag zurückzusetzen. Die Datei unter derselben Adresse zu aktualisieren, ist meist gesünder.

Dasselbe Prinzip gilt ebenso für saisonale Kataloge und Aktions PDFs. Bekommt jede Saison eine neue Adresse, verpuffen die Links der alten. Halten Sie das aktuelle PDF an einer festen Adresse und legen Sie alte Versionen auf einer Archivseite ab. Soll eine alte Version nicht ranken, nutzen Sie Noindex oder einen Canonical Header.

Die Seitenseite dieser Idee behandeln wir im Beitrag, ob saisonale Aktionsseiten ihre URL behalten sollten. Regeln für Slugs lesen Sie im Beitrag zum URL Slug, oder Sie nutzen unseren Slug Generator.

Warum wird ein PDF manchmal nicht indexiert?

Einige häufige Gründe halten ein PDF aus dem Index. Konkret hängen alle damit zusammen, ob Google die Datei finden und lesen kann. Die folgende Liste zeigt, was unser Team zuerst prüft.

  • Keine Seite verlinkt die Datei, daher kann Google sie nicht entdecken.
  • Eine robots.txt Regel sperrt den Ordner mit dem PDF.
  • Die Datei liegt hinter einem Login oder einer Formularschranke.
  • Der Server liefert einen Fehlercode oder den falschen Inhaltstyp.
  • Ein Noindex Header wurde früher gesetzt und danach vergessen.

Prüfen Sie die serverbezogenen Punkte zusammen mit Ihrer Entwicklung, denn sie sind die häufigste Ursache. Wie Sie Indexberichte lesen, zeigt unser Beitrag zum Finden nicht indexierter Seiten in der Search Console. Dieselbe Logik gilt für PDFs.

Erscheinen PDFs hinter einem Formular bei Google?

Meist nicht, weil Google kein Formular ausfüllt, um eine Datei herunterzuladen. Zum Beispiel bleibt ein Leitfaden, den Sie gegen eine E-Mail Adresse anbieten, verborgen. Ist das Ihre Absicht, gibt es also kein Problem. Sie wollen Kontakte gewinnen und nicht die Datei ranken lassen.

Achten Sie jedoch auf einen Widerspruch. Steht die direkte Adresse des PDFs anderswo im Netz, kann Google es trotzdem finden. Ist die Adresse also durchgesickert und soll die Datei nicht in der Suche erscheinen, setzen Sie einen Noindex Header oder schließen den Zugriff wirklich.

Bewerben Sie das PDF hinter dem Formular auf einer HTML Landingpage. Diese Seite kann ranken, und das PDF wird zur Belohnung nach dem Formular. So blockieren sich SEO und Conversion nicht gegenseitig.

Wie hängen PDF SEO und Barrierefreiheit zusammen?

Ein barrierefreies PDF hat eine feste Lesereihenfolge, markierte Überschriften und eine Textebene. Wir fanden keine offizielle Aussage, dass diese Merkmale das Google Ranking direkt ändern. Deshalb verkaufen wir Barrierefreiheit nicht als Ranking Versprechen.

Dennoch gibt es einen praktischen Nutzen. Ein PDF mit Textebene und sauberen Überschriften ist eine verlässlichere Quelle für Leser mit Screenreader und für Systeme, die Text auslesen. Barrierefreiheit unterstützt PDF SEO also indirekt.

Sie müssen nicht alles auf einmal erledigen, also starten Sie einfach. Nutzen Sie im Quelldokument echte Überschriftenformate, ergänzen Sie Beschreibungen für Bilder und wählen Sie beim Export die Option für ein getaggtes PDF. Menünamen unterscheiden sich je nach Programm, daher nennen wir keinen genauen Pfad.

Was passiert, wenn dasselbe PDF unter mehreren URLs liegt?

Dieselbe Datei kann zum Beispiel im Hauptordner, in einem Aktionsordner und unter einer Adresse mit Parameter liegen. Google behandelt das als getrennte URLs. Die Signale teilen sich, und es bleibt unklar, welche Adresse in der Suche erscheint.

Finden Sie zuerst die Kopien in Ihrem Inventar. Wählen Sie danach eine Hauptadresse. Löschen Sie dann die anderen, leiten Sie sie um oder verweisen Sie per Canonical Header auf die Hauptadresse. Löschen und Umleiten sind am saubersten, während der Header hilft, wenn die Datei an ihrem Ort bleiben muss.

Die Parameter Seite behandeln wir im Beitrag zu URL Parametern und SEO. Dasselbe Prinzip gilt für PDF Adressen.

Wie überwachen Sie die Leistung Ihrer PDFs?

In ein PDF können Sie keinen Seiten Trackingcode einbauen, deshalb messen Sie indirekt. Prüfen Sie zuerst mit der Suche nach site und filetype, welche PDFs indexiert sind. Untersuchen Sie danach die PDF Adresse mit dem URL Inspection Tool der Search Console. Der Name des Tools kann sich in der Oberfläche ändern.

Danach schauen Sie auf Links. Welche Seiten verlinken das PDF, und welche Seite schickt die Klicks? Ergänzen Sie am Download Link auf der Seite ein Ereignis Tracking, damit Sie Downloads im Kontext einer Seite sehen.

Für einen breiteren Blick auf die Indexierung nutzen Sie unsere Anleitung zur Search Console. Sammeln sich zu viele PDFs im Index, betrifft Sie unser Beitrag zu Index Bloat.

Welche Fehler passieren bei PDF SEO am häufigsten?

Die Fehler, die wir in der Praxis sehen, wiederholen sich oft, daher hilft eine kurze Liste. Die folgende Aufzählung nennt fünf davon. Es sind unsere Beobachtungen und keine offizielle Warnliste von Google.

  • Dateiname und Dokumenttitel leer oder bedeutungslos lassen.
  • Ein gescanntes Dokument ohne Textebene als einzige Version veröffentlichen.
  • Denselben Inhalt als PDF und HTML veröffentlichen, ohne beide in Beziehung zu setzen.
  • Ein unerwünschtes PDF in der robots.txt sperren, sodass Google die Noindex Regel nie liest.
  • Alte Aktionsdateien online lassen, sodass veraltete Preise im Index bleiben.

Ein kleines Inventar fängt diese PDF SEO Fehler daher ab. Legen Sie eine Tabelle an mit Adresse, Titel, Status der Textebene, zugehöriger HTML Seite und der Entscheidung, ob die Datei bleibt oder geht. Ein Teil dieser Fehler hängt auch an schwacher interner Verlinkung, die wir in der Strategie zur internen Verlinkung behandeln.

Welche PDF SEO Checkliste sollten Sie vor der Veröffentlichung durchgehen?

Diese Liste sammelt die Grundprüfungen, die unser Team vor jeder Veröffentlichung eines PDFs macht. Jeder Punkt stammt aus den offiziellen Google Dokumenten oder aus unserer Praxis.

  • Hat die Datei eine Textebene? Prüfen Sie das durch Markieren und Kopieren.
  • Ist der Dokumenttitel ausgefüllt und aussagekräftig?
  • Sind Personennamen, interne Notizen oder vertrauliche Daten in den Metadaten geblieben?
  • Nennt der Dateiname das Thema, und fehlen Jahreszahlen und Versionsangaben?
  • Ist der Ankertext jedes Links auf das PDF beschreibend?
  • Zeigt das Canonical Signal bei vorhandener HTML Version auf die richtige Seite?
  • Haben PDFs, die nicht in den Index sollen, einen Noindex Header, ohne robots.txt Sperre?
  • Ist die Dateigröße vernünftig, und öffnet die Datei gut auf dem Smartphone?

Drucken Sie die Liste aus und geben Sie sie Ihrem Team. Bitten Sie außerdem jeden, der ein PDF veröffentlicht, die Punkte abzuhaken. Denn die Wiederholung bei jedem PDF kostet weit weniger als späteres Aufräumen.

Wie gehen wir bei einer PDF SEO Prüfung vor?

Bei Talha Aslan und Team beginnen wir eine PDF Prüfung mit der Liste der Dateien im Index. Danach ordnen wir jede Datei einer von drei Gruppen zu: Dateien, die ranken sollen, Dateien, die wir auf eine HTML Seite lenken wollen, und Dateien, die den Index verlassen müssen. Die Ergebnisse zeigen wir als Beispieltabelle, ohne erfundene Zahlen und ohne Garantien.

Die Header Einstellungen planen wir gemeinsam mit Ihrem Serveradministrator, denn der Serverbetrieb gehört nicht zu unserem Geschäft. Brauchen Sie eine breitere Prüfung, sehen Sie sich unsere SEO Beratung an. Für einen schnellen ersten Check probieren Sie unseren SEO Check und testen mit der Google SERP Vorschau, wie ein Ergebnis aussehen kann.

Häufig gestellte Fragen

Ranken PDFs bei Google?
Ja, das können sie. Google zählt das Adobe PDF Format zu den Dateitypen, die es indexiert. Ob ein PDF gut rankt, hängt von seinem Titel, vom lesbaren Text, von den Links darauf und vom Verhältnis zu einer HTML Seite mit gleichem Inhalt ab. Für kein PDF gibt es eine garantierte Position, also beobachten Sie die Ergebnisse mit eigenen Suchen und Search Console Daten.
Woher kommt der Titel eines PDFs bei Google?
Laut dem offiziellen Google Blogbeitrag zu PDFs sind der Titel in den Dateimetadaten und der Ankertext der Links auf das PDF wichtige Signale. Die Dokumentation zu Titellinks von HTML Seiten erwähnt PDFs nicht. Tragen Sie daher den Dokumenttitel ein, schreiben Sie beschreibende Linktexte und beobachten Sie, wie der Titel in den Suchergebnissen erscheint.
Indexiert Google gescannte Bild PDFs?
Möglich ist es, aber es gibt keine Garantie. Der Google Blogbeitrag zu PDFs sagt, dass Bilder mit Text per OCR verarbeitet werden können. Diese Aussage fanden wir nicht wörtlich in den aktuellen Hilfeseiten. Der sichere Weg ist ein PDF mit Textebene und derselbe Inhalt als HTML Seite. Die Textebene testen Sie durch Kopieren von Text.
Wie entferne ich ein PDF aus dem Google Index?
Sie können die Datei vom Server löschen oder per X-Robots-Tag HTTP Header eine Noindex Regel setzen, die Google für Ressourcen ohne HTML empfiehlt. Sperren Sie die Datei nicht in der robots.txt, sonst kann Google den Header nicht lesen. Für dringende und sensible Fälle bietet das Removals tool eine vorübergehende Lösung, dauerhaft hilft das Löschen.
Was tun, wenn PDF und HTML Seite denselben Inhalt haben?
Entscheiden Sie, welche Version ranken soll. Für die meisten Unternehmen ist das die HTML Seite. Bitten Sie Ihren Serveradministrator, einen Canonical HTTP Header an die PDF Antwort anzuhängen. Google unterstützt das für Formate wie PDF, doch ein Canonical ist ein Hinweis, und Google entscheidet am Ende. Halten Sie außerdem die Links auf das PDF einheitlich.
Helfen Links in einem PDF beim Ranking?
In den offiziellen Google Dokumenten fanden wir keine klare Aussage dazu, wie Links in PDFs das Ranking beeinflussen, deshalb behaupten wir nichts Festes. Links helfen Lesern dennoch, die richtige Seite zu erreichen. Nutzen Sie vollständige Adressen mit beschreibendem Text und richten Sie auf der Zielseite eine Messung ein, um die Wirkung der Klicks zu sehen.
  • pdf seo
  • pdf indexierung
  • x-robots-tag
  • canonical header
  • pdf titel
  • pdf aus google entfernen
  • technisches seo
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.