Saltar al contingut principal
SEO Tècnic 18 min

SEO per a PDF: indexació i optimització útil - Ighenatt Blog

Aprèn quan convé publicar en PDF o HTML i com optimitzar rastreig, indexació, accessibilitat, versions i mesurament dels documents. Llegeix l'article complet...

EG

Elu Gonzalez

Autor

Com s'optimitza un PDF per als cercadors?

Primer decideix si el contingut ha de ser realment un PDF. Si necessita maquetació fixa, impressió o descàrrega, publica'l en una URL estable i rastrejable, amb text seleccionable, un nom de fitxer descriptiu i un títol de document correcte. Enllaça'l des de pàgines HTML relacionades, retorna Content-Type: application/pdf i afegeix-lo al sitemap quan sigui una destinació canònica útil. Gestiona canònics i directives d'indexació amb capçaleres HTTP, mantén una sola versió vigent i prova l'ordre de lectura, els enllaços i l'accessibilitat del fitxer descarregat.

Idees clau

  • Publica en HTML el contingut que canvia sovint, necessita interacció adaptable o forma part d'una conversió; reserva el PDF per a documents on importen la descàrrega, la impressió o una edició fixa.
  • Google pot indexar PDF, però la descoberta i l'extracció depenen d'una URL rastrejable, enllaços normals, text llegible i una resposta HTTP usable.
  • Els canònics i les directives robots d'un PDF es configuren a les capçaleres HTTP, no en una etiqueta HTML d'una altra pàgina.
  • L'OCR és una recuperació per a documents escanejats, no una validació: cal revisar text, idioma, ordre de lectura, títols, taules i xifres.
  • Mesura impressions, clics, descàrregues i accions posteriors per separat, amb una persona responsable de cada document i una política de substitució.

Un PDF pot aparèixer als resultats de Google, però limitar l’estratègia a “Google indexa PDF” deixa gairebé tota la feina per fer. Abans de tocar metadades convé respondre quatre preguntes: aquest contingut necessita el format PDF, el rastrejador pot arribar al fitxer, el text es pot extreure en l’ordre correcte i una persona el podrà fer servir des del mòbil o amb tecnologia d’assistència?

La decisió pràctica és tractar el PDF com un document, no com una pàgina web de recanvi. HTML encaixa millor en un recorregut que canvia, en una explicació de servei o en una pàgina que demana interacció. El PDF resol bé una altra mena de feina: descarregar, imprimir, preservar una edició o mantenir una paginació exacta. Quan calen tots dos formats, s’ha de decidir quina URL volem com a resultat de cerca i mantenir els senyals coherents.

Google inclou actualment PDF entre els formats de document codificats que pot indexar. També indica que identifica el tipus de fitxer sobretot mitjançant la capçalera HTTP Content-Type, tot i que pot recórrer a l’extensió o a altres mètodes si la capçalera falta o és incorrecta (Google Search Central). És una capacitat tècnica, no una promesa: un PDF que es pugui processar pot quedar orfe, exclòs, duplicat o per sota d’un resultat que resol millor la consulta.

Decideix entre PDF i HTML abans d’optimitzar

Comença per la tasca de la persona que arribarà al contingut. Un manual d’instal·lació pot ser útil com a descàrrega al costat de la interfície del producte. Una memòria anual necessita una edició datada que no canviï cada setmana. Una llista de comprovació imprimible es beneficia de pàgines previsibles. En canvi, una tarifa viva, una pàgina de servei o una política que rep correccions freqüents acostumen a funcionar millor en HTML.

Tria HTML quan… Tria PDF quan…
El contingut canvia sovint o mostra dades actuals L’edició ha de quedar fixada, datada o arxivada
La lectura adaptable en mòbil és una prioritat Imprimir o consultar sense connexió és part de la tasca
Calen navegació, filtres, formularis o calculadores La paginació i la posició visual han de ser exactes
La informació forma part d’un recorregut de conversió És un informe signat, una especificació o un registre formal
S’han de reutilitzar components i dades estructurades Es necessita un fitxer portàtil i autocontingut

Per a moltes organitzacions catalanes, la combinació més neta és una pàgina HTML útil més el document. La pàgina indica què conté, a qui s’adreça, de quina data és i quant ocupa. També pot publicar una correcció o resumir conclusions sense obligar ningú a obrir un informe pesant. El PDF conserva la seva funció pròpia.

Una pàgina que només repeteix el títol i afegeix un botó de descàrrega no arregla el problema. Crea una URL feble més. Si publiques la versió HTML, dona-li utilitat independent: un resum accessible, les troballes principals, un historial de versions, context relacionat i el següent pas que pot fer el lector.

Si el contingut es duplica, escull una destinació de cerca

Quan HTML i PDF contenen pràcticament el mateix, documenta quin dels dos ha de ser la URL canònica. Google admet una capçalera de resposta HTTP per indicar la URL canònica dels documents que no són HTML, inclosos els PDF. La documentació de Google sobre URLs canòniques especifica que aquesta capçalera és Link amb el valor rel="canonical", i que la destinació ha de ser una URL absoluta.

La sintaxi de la capçalera de vinculació web està normalitzada a RFC 8288. El text complet de l’estàndard RFC 8288 defineix com expressar una relació entre el recurs i una altra URL en una resposta HTTP.

Si la versió HTML és la preferida, la resposta del PDF pot incloure:

HTTP/1.1 200 OK
Content-Type: application/pdf
Link: <https://www.example.cat/estudis/comerc-electronic-2026/>; rel="canonical"

No marquis un informe complet i el seu resum com a versions canòniques entre si només perquè parlen del mateix estudi. El senyal canònic serveix per consolidar representacions duplicades o molt semblants; no és una etiqueta genèrica per dir que dos recursos tenen relació.

La capçalera ha de sortir a la resposta del PDF. Afegir un element canònic a la pàgina de descàrrega, al gestor JavaScript o a les propietats internes del fitxer no configura la URL canònica del PDF. Comprova la URL desplegada amb curl -I o un inspector de capçaleres i revisa la resposta final si hi ha redireccions.

Dona al rastrejador una ruta estable

Un fitxer públic que només apareix després d’enviar un formulari, obrir un correu o executar un script té una via de descoberta fràgil. Si el document ha de participar en cerca orgànica, enllaça’l amb un element HTML normal des d’una pàgina indexable i relacionada. El text de l’enllaç ha d’explicar quin document s’obre; el paràgraf del voltant pot precisar tema, edició i públic.

Fes servir una URL estable i recognoscible, per exemple /informes/comerc-electronic-catalunya-2026.pdf. Evita identificadors interns, paràmetres de sessió i noms com informe-final-bo-v8.pdf. Un bon nom ajuda a identificar el fitxer un cop descarregat i redueix confusions entre versions. No és, per si sol, un factor que garanteixi posicions.

Els PDF que vols indexar també poden aparèixer en un sitemap XML. Google demana URLs absolutes que representin destinacions que voldries mostrar a la cerca, i descriu la inclusió al sitemap com un senyal canònic, no com una garantia (documentació de sitemaps de Google). El sitemap ajuda amb l’inventari i la descoberta. No compensa un document orfe.

Abans de publicar, comprova aquests punts:

  1. La URL pública funciona sense autenticació, cookies obligatòries ni paràmetres que caduquen.
  2. La resposta final és 200 i declara Content-Type: application/pdf.
  3. Una o més pàgines HTML pertinents enllacen la URL final amb context descriptiu.
  4. Les redireccions són curtes i acaben a l’edició mantinguda.
  5. El sitemap inclou el fitxer si és una destinació canònica que vols indexar.
  6. Cap regla del CDN o del servidor no afegeix noindex per accident a totes les descàrregues.

Els documents d’intranet, per a clients o protegits amb contrasenya han de quedar fora de la cerca pública expressament. No rebaixis el control d’accés per obtenir visibilitat. robots.txt i les directives robots no autentiquen ningú: qualsevol persona que conegui una URL pública pot provar d’obrir-la.

El text s’ha de poder extreure, no només veure

Obre el fitxer i prova de seleccionar una frase, cercar-hi una expressió distintiva i enganxar el fragment en un editor de text pla. Si no funciona, és probable que les pàgines siguin imatges. Els mots es veuen, però cercar, traduir, copiar o llegir amb eines d’assistència es torna poc fiable.

Quan conserves el document font, exporta’l des de l’aplicació original i preserva fonts i text Unicode. Per a escanejos, el reconeixement òptic de caràcters pot afegir una capa textual. L’OCR només inicia la recuperació. Revisa noms propis, dates, separadors decimals, taules, notes al peu i columnes. Un 8 convertit en 3 dins d’un pressupost pot passar desapercebut perquè la pàgina visual continua semblant correcta.

Després mira l’ordre de lectura. Les coordenades visuals no expliquen necessàriament en quina seqüència el programari exposarà títols, columnes, peus o llegendes. Les etiquetes estructurals poden definir encapçalaments, paràgrafs, llistes, taules i figures. Els enllaços necessiten anotacions funcionals, i les propietats del document han d’indicar idioma i títol.

Tot això té valor més enllà del rastreig. Permet cercar dins d’un informe llarg, copiar una referència, moure’s per encapçalaments o escoltar el document amb un lector de pantalla. WCAG és un estàndard d’accessibilitat web estable i referenciable publicat pel W3C. La pàgina de WCAG del W3C WAI n’explica l’abast i les versions.

PDF/UA és la família ISO centrada en tecnologia PDF accessible (PDF Association). Afegir etiquetes o passar un verificador automàtic no demostra la conformitat: la validació de PDF/UA també exigeix comprovacions detallades i confirmació humana.

Les metadades identifiquen, però no rescaten el contingut

Configura un títol breu a les propietats del PDF i fes que concordi amb l’encapçalament visible de la primera pàgina. Afegeix l’organització autora i l’assumpte quan siguin dades certes. Elimina el nom de la plantilla, rutes del disc local i autors que hagin quedat del fitxer de mostra.

Les metadades ajuden les persones i el programari a identificar el document. No hi ha base per tractar una llista llarga de paraules clau amagada a les propietats com una palanca SEO. El cos necessita títols informatius, explicacions i taules etiquetades. Aplanar gràfics i text en una sola imatge o convertir totes les lletres en traçats dificulta l’extracció.

Els enllaços interns del PDF també han de sobreviure a l’exportació. Enllaça les citacions amb la font, escriu la URL quan la còpia impresa l’hagi de conservar i envia els passos comercials a la versió lingüística correcta. Prova els enllaços al fitxer acabat; no donis per fet que l’eina d’autoria els ha mantingut.

Controla la indexació amb capçaleres HTTP

Les etiquetes robots meta d’una pàgina HTML viuen dins del seu <head>. Un PDF no té aquest element, de manera que les directives d’indexació s’han d’enviar a la resposta HTTP.

Google documenta X-Robots-Tag com una capçalera HTTP per enviar directives d’indexació en recursos que no són HTML. La documentació de Google Search Central també adverteix que només pot llegir la regla si el rastrejador té permís per recuperar la URL.

Per retirar de l’índex de Google un PDF públic mantenint-lo accessible:

HTTP/1.1 200 OK
Content-Type: application/pdf
X-Robots-Tag: noindex

No bloquegis alhora aquesta URL a robots.txt esperant que Google llegeixi el noindex. El bloqueig impedeix obtenir la resposta que conté la directiva. Si el document és confidencial, treu-lo de l’accés públic i protegeix-lo amb autenticació o un mecanisme real de control d’accés.

Audita les regles del CDN, l’emmagatzematge d’objectes i el servidor segons la ruta de resposta. Una regla massa àmplia sobre /descarregues/ pot deixar tots els informes fora de l’índex. Una expressió sensible a majúscules pot tractar .pdf i .PDF de manera diferent. Inspecciona diversos fitxers representatius en producció.

La capçalera HTTP Link també permet descriure alternatives lingüístiques de fitxers que no són HTML. La documentació d’internacionalització de Google posa els PDF com a cas d’ús de hreflang a les capçaleres i demana que el conjunt inclogui totes les versions, també la mateixa URL (Google Search Central). Aplica-ho només a traduccions equivalents de debò. Canviar la portada i deixar el cos en castellà no crea una versió catalana.

Enllaça el document des del context on es prendrà la decisió

Molts problemes de SEO per a PDF neixen fora del fitxer. L’equip puja un informe, l’enllaça des d’una notícia i, uns mesos després, la notícia desapareix de la navegació. El document segueix al servidor, però ha perdut el context que n’explicava la vigència.

Crea una pàgina HTML estable per a cada família important: estudis, memòries, manuals, normatives internes o especificacions. Relaciona cada edició amb l’actual. Enllaça el document des de pàgines de servei o de tema quan resolgui una pregunta concreta. La guia d’auditories SEO tècniques ajuda a revisar el recorregut de rastreig i indexació; l’anàlisi de logs del servidor permet comprovar si els bots demanen de debò les URLs dels documents.

Al PDF, afegeix una tornada al context web que es manté. El fitxer descarregat circula sense la pàgina d’origen, per tant hauria d’incloure organització, data de publicació, ubicació web canònica i una acció posterior útil. És navegació per al lector, no una tàctica per fabricar autoritat.

Gestiona versions sense acumular duplicats

Abans de publicar, defineix si la URL representa una edició immutable o un document viu.

Un informe tancat pot dur l’any a l’adreça: /informes/comerc-electronic-2026.pdf. Quan arribi l’edició següent, publica una URL nova i actualitza l’índex d’informes. Mantén l’anterior si té valor històric i mostra-hi la data de manera visible.

Per a un manual viu, una URL estable com /suport/manual-installacio.pdf pot ser adequada. Substitueix el fitxer quan tothom hagi de rebre les instruccions més recents. Escriu dins del document el número de revisió i la data d’entrada en vigor. Si l’operació obliga a conservar còpies antigues, desa-les fora de la ruta pública actual i vigila que la memòria cau no barregi edicions.

No deixis indexables alhora informe.pdf, informe-final.pdf, informe-final-2.pdf i informe-2026.pdf. Tria la URL mantinguda. Redirigeix els duplicats obsolets quan hi hagi un substitut clar; si no, retorna l’estat de retirada que pertoqui. Quan una edició antiga hagi de continuar pública, marca-la com a arxivada i enllaça la vigent en comptes de fingir que són la mateixa cosa.

Una fitxa mínima de propietat evita moltes decisions improvisades:

Camp Què cal registrar
Responsable Equip o persona que manté contingut i configuració HTTP
Propòsit Descàrrega, registre formal, material imprimible o arxiu
Destinació canònica El PDF o una versió HTML equivalent
Data efectiva Moment en què l’edició va entrar en vigor
Data de revisió Quan es tornaran a comprovar les afirmacions, els enllaços i l’accessibilitat
Acció de substitució Reemplaçar, crear una edició, redirigir o arxivar

Mesura el PDF com una part del recorregut

Search Console pot mostrar impressions, clics, consultes i països d’una URL PDF quan aquesta URL té dades a la propietat. És un punt de partida, no una prova que el document hagi funcionat. La persona pot haver fet clic i haver abandonat davant de dues columnes il·legibles al mòbil; també pot haver completat la tasca sense tornar al web.

Separa el mesurament en capes:

  • Descoberta: impressions, clics, grups de consultes, pàgines que enllacen el document i peticions de rastreig.
  • Ús: clics al botó de descàrrega, respostes del PDF, mida, dispositiu i interaccions només quan el visor o sistema les pugui registrar de manera fiable.
  • Resultat: retorn al web, formulari completat, reducció de consultes a suport, lectura d’una política o qualsevol acció que respongui al propòsit real.

Mantén l’analítica proporcionada i compatible amb el model de consentiment. Els logs poden comptar respostes correctes del PDF sense inserir seguiment al document. Una pàgina HTML pot mesurar la descàrrega. Els enllaços etiquetats des del fitxer poden diferenciar referències, sempre que els paràmetres i la privacitat estiguin ben resolts.

Compara PDF i HTML per tasca, no només per visites. Si el resum HTML capta consultes informatives i l’informe genera descàrregues útils, la parella pot estar fent la seva feina. Si el PDF rep clics per una consulta rellevant però força a ampliar cada pàgina abans d’arribar a un telèfon caducat, la visibilitat no és èxit.

Una seqüència de QA que es pugui repetir

Executa les proves sobre la URL desplegada, no només sobre el fitxer font:

  1. Format: confirma per què cal el PDF i si també fa falta un resum o alternativa HTML.
  2. Contingut: revisa títol, edició, responsable, encapçalaments, taules, citacions i acció posterior.
  3. Extracció: selecciona, cerca i enganxa text; comprova errors d’OCR i ordre de lectura.
  4. Accessibilitat: inspecciona etiquetes, idioma, jerarquia, text alternatiu, propòsit dels enllaços, taules, teclat i contrast; prova una tecnologia d’assistència pertinent.
  5. Lliurament: valida estat HTTP, Content-Type, mida, memòria cau, redireccions i descàrrega en mòbil.
  6. Indexació: revisa X-Robots-Tag, canònic, idiomes, enllaços interns i sitemap.
  7. Duplicació: cerca versions públiques antigues al CMS i a l’emmagatzematge i decideix què fer-ne.
  8. Mesurament: comprova que la URL, l’esdeveniment de descàrrega o la consulta de logs aparegui al flux d’informes.

Les eines automàtiques troben etiquetes absents, estructures incorrectes i respostes mal configurades. No poden decidir si l’ordre narratiu és lògic, si un gràfic s’explica prou o si publicar en PDF era la decisió adequada. Completa-les amb una lectura manual en escriptori, mòbil i almenys un flux d’assistència rellevant per al públic.

Preguntes freqüents sobre SEO per a PDF

Google indexa els fitxers PDF?

Sí. Google inclou PDF entre els formats de document que pot indexar. Això no vol dir que rastregi, indexi o posicioni qualsevol PDF: la URL ha de ser accessible i fàcil de descobrir, i el document ha de contenir informació útil que es pugui extreure.

Un PDF és pitjor que una pàgina HTML per al SEO?

No sempre. HTML acostuma a ser el format principal més pràctic quan el contingut canvia sovint, s’ha d’adaptar bé a pantalles petites, necessita components estructurats o acompanya una conversió. El PDF té sentit quan la descàrrega, la impressió, la paginació formal o la conservació d’una edició fixa formen part de la necessitat.

Com s’indica la URL canònica d’un PDF?

Envia una capçalera HTTP Link a la resposta de la URL del PDF i usa una URL canònica absoluta, per exemple: Link: <https://example.com/url-preferida/>; rel="canonical". Una etiqueta link situada en una pàgina HTML diferent no estableix la URL canònica del fitxer.

Cal incloure els PDF al sitemap XML?

Inclou-hi un PDF si és una URL canònica que vols que s’indexi i el document té prou valor per mantenir-lo. El sitemap ajuda a descobrir la URL i aporta un senyal canònic, però no substitueix els enllaços interns ni garanteix la indexació.

Es pot posicionar un PDF escanejat que només conté imatges?

No hi confiïs. Aplica OCR o, millor encara, torna a generar el document amb text real. Després comprova que es pugui seleccionar, cercar i llegir amb tecnologia d’assistència en un ordre coherent. Una capa de text amb errors en noms, xifres o títols continua sent un document defectuós.

El pas següent útil és fer inventari, no reescriure metadades en massa. Llista cada PDF públic amb responsable, última actualització, enllaços interns, estat d’indexació, destinació canònica i situació d’accessibilitat. Conserva els que compleixen una funció documental real. Passa a HTML el contingut web que necessita canvis i dona als PDF que quedin la mateixa cura editorial, tècnica i d’accessibilitat que a qualsevol altra superfície publicada.

Comparteix aquest article

Si t'ha resultat útil aquest contingut, comparteix-lo amb els teus col·legues.

Twitter LinkedIn

Preguntes Freqüents

Google indexa els fitxers PDF?

Sí. Google inclou PDF entre els formats de document que pot indexar. Això no vol dir que rastregi, indexi o posicioni qualsevol PDF: la URL ha de ser accessible i fàcil de descobrir, i el document ha de contenir informació útil que es pugui extreure.

Un PDF és pitjor que una pàgina HTML per al SEO?

No sempre. HTML acostuma a ser el format principal més pràctic quan el contingut canvia sovint, s'ha d'adaptar bé a pantalles petites, necessita components estructurats o acompanya una conversió. El PDF té sentit quan la descàrrega, la impressió, la paginació formal o la conservació d'una edició fixa formen part de la necessitat.

Com s'indica la URL canònica d'un PDF?

Envia una capçalera HTTP Link a la resposta de la URL del PDF i usa una URL canònica absoluta, per exemple: Link: <https://example.com/url-preferida/>; rel="canonical". Una etiqueta link situada en una pàgina HTML diferent no estableix la URL canònica del fitxer.

Cal incloure els PDF al sitemap XML?

Inclou-hi un PDF si és una URL canònica que vols que s'indexi i el document té prou valor per mantenir-lo. El sitemap ajuda a descobrir la URL i aporta un senyal canònic, però no substitueix els enllaços interns ni garanteix la indexació.

Es pot posicionar un PDF escanejat que només conté imatges?

No hi confiïs. Aplica OCR o, millor encara, torna a generar el document amb text real. Després comprova que es pugui seleccionar, cercar i llegir amb tecnologia d'assistència en un ordre coherent. Una capa de text amb errors en noms, xifres o títols continua sent un document defectuós.

Mantén-te actualitzat

Rep al teu email els últims articles, consells i estratègies sobre SEO, rendiment web i màrqueting digital.

Enviem un butlletí cada setmana, i pots donar-te de baixa en qualsevol moment.

Tags: #SEO per a PDF #SEO tècnic #indexació #accessibilitat #estratègia de continguts
EG

Elu Gonzalez

Expert SEO & Optimització Web