SEO Playbook · Element

Incrustaciones de audio y podcasts: publicación priorizando la transcripción

Crea una incrustación de audio accesible con un reproductor rápido, transcripción completa indexable, capítulos útiles, metadatos honestos y alternativas resilientes para podcasts hoy.

18 min read

Una incrustación de audio es una grabación reproducible con título, resumen, duración, atribución, controles y transcripción completa. Abarca audio propio y reproductores de podcasts aprobados, pero la transcripción es el artefacto indexable canónico y debe hacer que la página sea útil cuando nadie presiona Reproducir.

Cómo validamos la migración sin perder tráfico orgánico
Una entrevista de 14 minutos con el líder técnico, editada para mayor claridad y publicada con capítulos etiquetados por orador.
Reproducir episodio · 14:06 · Leer la transcripción

El lector conoce el tema, formato, esfuerzo y alternativa textual antes de la reproducción. La producción añade controles nativos o un proveedor aprobado, dejando el título, resumen y transcripción en el HTML inicial.

Por qué este elemento es importante

El audio preserva el énfasis, la hesitación, la emoción, la pronunciación y la interacción entre los hablantes. Esto lo hace útil cuando la expresión oral es parte de la evidencia y permite a los lectores escuchar mientras hacen otra tarea. La duración les da un costo honesto antes de comprometerse.

El audio también es lineal: un oyente no puede ver el argumento completo de una vez y puede tener que avanzar minutos para recuperar un solo dato. Un reproductor misterioso pide tiempo antes de establecer valor, mientras que la reproducción automática secuestra la atención. Usa una introducción descriptiva, duración, capítulos para grabaciones largas, controles de reproducción y una transcripción consultable.

La capacidad de extracción automática depende del texto, no del reproductor. No se puede esperar que los rastreadores y sistemas de recuperación de IA transmitan audio, reconozcan a cada hablante o distingan una corrección de la afirmación que corrige. Publica la transcripción completa como HTML renderizado en el servidor, con nombres de los hablantes, encabezados, marcas de tiempo útiles y citas adjuntas a las afirmaciones que respaldan.

Aplica las reglas de redacción de elementos antes de elegir este componente. Su regla de precedencia es semántica: cuando el propósito de un bloque es permitir al lector reproducir e inspeccionar audio significativo, usa el elemento de audio tipificado en lugar de estilizar un enlace o iframe para que se parezca a uno. Por el contrario, no añadas un componente de audio solo porque una plantilla de página tenga un espacio vacío para medios.

Cuándo usarlo

Usa una incrustación de audio cuando escuchar la grabación aporte evidencia, pronunciación, emoción o conveniencia que la prosa por sí sola no preserva. Buenos usos incluyen un episodio de podcast, entrevista documentada, clip de historia oral, testimonio de cliente, respuesta de experto, comparación de sonido de producto o versión en audio por encargo de un artículo extenso.

La grabación necesita un propietario estable, permiso de publicación, transcripción verificada y una relación clara con la página. Si solo importan 90 segundos de una entrevista de 40 minutos, usa el extracto o un enlace de capítulo con marca de tiempo junto a la afirmación.

Los casos cercanos necesitan otro tratamiento:

  • Un video con demostraciones significativas: usa una incrustación de video . Extraer su audio descarta las instrucciones visuales y crea una alternativa incompleta.
  • Una cita de una entrevista grabada: cita el pasaje aprobado en prosa y referencia la grabación. Un reproductor completo es innecesario cuando la tarea editorial es la atribución de una sola declaración.
  • Narración sintética de una página corta: conserva el texto. Repetir 300 palabras añade mantenimiento sin mejorar la recuperación.
  • Música de fondo o paisaje sonoro decorativo: omítelo del contenido editorial. La decoración no debe competir con el habla, reproducirse automáticamente ni crear un problema de control oculto.
  • Una descarga sin reproducción en página: usa un enlace de archivo con formato y tamaño. Llamarlo incrustación promete controles que no existen.
  • Una transmisión en vivo: usa un patrón de evento dedicado con estado, horario, zona horaria y alternativa de grabación. Un elemento de audio de duración finita no puede describir honestamente una transmisión abierta.
  • Una transcripción automática no revisada: no la publiques como completa. Los errores en nombres, negaciones, números y cambios de hablante pueden invertir el significado.

Dónde colocarlo

Coloca el elemento después de un párrafo que nombre la grabación, explique por qué pertenece y declare qué aprenderán los lectores. Presenta a un entrevistado antes del clip; establece un resultado de caso de estudio antes del audio de respaldo; mantén la documentación escrita como autoridad antes de una narración opcional.

En una página liderada por un podcast, el reproductor puede seguir al héroe, pero la transcripción y las afirmaciones clave siguen siendo la sustancia. Coloca un extracto de respaldo después de su afirmación y antes del análisis dependiente; mantén un clip con marca de tiempo junto con su pasaje de transcripción.

Mantén el encabezado, resumen, reproductor, duración, atribución, capítulos, control de transcripción y alternativa en una región etiquetada. La transcripción puede seguir o usar un panel de divulgación accesible, pero su HTML completo debe enviarse inicialmente. Nunca la bloquees ni la obtengas solo después de la reproducción.

La incrustación no puede estar junto a otro reproductor, video con reproducción automática, anuncio sonoro, formulario de captación de leads o llamada a la acción de alta prioridad. No puede separar una advertencia de su acción, interrumpir un paso numerado ni dividir una cita de su atribución. Deja suficiente separación para que sus controles pertenezcan claramente al audio.

Anatomía

La captura de pantalla etiquetada debe identificar:

  1. Título: nombra el episodio o extracto específicamente; no repite el título de la página sin añadir alcance.
  2. Resumen: indica quién habla, qué se cubre y por qué es útil escuchar en una o dos oraciones.
  3. Reproductor: usa controles nativos o revisados para reproducir, pausar, buscar, volumen, tiempo transcurrido y duración.
  4. Duración: aparece como texto fuera del control para que el esfuerzo se conozca antes de que cargue el reproductor.
  5. Atribución y fecha: identifica a los hablantes, publicador, fecha de grabación o publicación y contexto de permiso relevante.
  6. Capítulos: proporciona etiquetas cortas y marcas de tiempo para grabaciones de más de diez minutos o que contengan temas distintos.
  7. Acceso a la transcripción: expone una transcripción completa, editada y etiquetada por hablante, disponible sin reproducción.
  8. Alternativa: proporciona un enlace HTTPS canónico al episodio o archivo cuando falla el reproductor incrustado.
  9. Información de descarga: cuando se permiten descargas, indica el formato y el tamaño aproximado del archivo antes de la solicitud.
  10. Aviso del proveedor: explica cuándo un proveedor externo recibe una solicitud o establece almacenamiento, antes de que ocurra esa conexión cuando se requiere consentimiento.

Ejemplos de diseño

Cada variante preserva el título, resumen, duración, atribución, transcripción completa y alternativa. La presentación puede cambiar; el contrato de información no.

Reproductor nativo en línea — predeterminado

Usa los controles del navegador para medios propios aprobados. Esta es la opción menos sorprendente y evita un widget de podcast pesado. Añade codificaciones solo cuando los datos de compatibilidad lo justifiquen, y devuelve el tipo de medio correcto y el comportamiento de rango de bytes.

Tarjeta de episodio de podcast

Úsala para un episodio genuino con nombre de serie, título, fecha, número de episodio estable y enlace canónico. Añade imagen de portada solo cuando exista el recurso aprobado. Coloca las acciones de suscripción después del punto de entrada de la transcripción.

Reproductor de formato largo con capítulos

Úsalo por encima de diez minutos o cuando cambien los temas. Los capítulos necesitan etiquetas descriptivas, no «Parte dos». Cada marca de tiempo debe buscar en el reproductor y también identificar un encabezado de transcripción sin necesidad de scripting.

Extracto priorizando la transcripción

Úsalo cuando un pasaje corto respalde una afirmación. Muestra su transcripción, revela las ediciones por puntuación o extensión, y enlaza al contexto completo. Nunca hagas que oraciones separadas suenen continuas sin marcar la edición.

Proveedor con puerta de consentimiento

Úsalo cuando un anfitrión externo requiera permiso. Nombra al proveedor y la consecuencia, luego ofrece una acción precisa como «Permitir proveedor y cargar reproductor». Rechazar deja utilizables el resumen, la transcripción y el enlace canónico.

Parámetros

«Fuente» significa la ubicación de autoría desde la cual el renderizador obtiene el valor. No significa el publicador del audio ni la fuente de evidencia.

NombreTipoObligatorioMín/máxPredeterminadoFuente
titleCadena simple4–14 palabras; 100 caracteresNingunoPrimer encabezado del cuerpo
srcRuta relativa a la raíz o URL HTTPS aprobadaUna fuente de audio; 2048 caracteresNingunoAtributo
providerEnumeraciónNonative o un ID de proveedor aprobadonativeAtributo
variantEnumeraciónNoinline, podcast, chaptered, transcript-first, consentinlineAtributo
durationDuración ISO 8601PT1SPT24HNingunoAtributo
publishedFecha ISO 8601Sí para episodiosUna fecha de publicación realNingunoAtributo
seriesCadena simpleCondicional para podcast2–100 caracteresNingunoAtributo
episodeCadena simple o enteroNo1–30 caracteresNingunoAtributo
media-typeTipo MIMESí para nativoUn tipo MIME de audio compatibleDerivado solo de metadatos de medio confiablesAtributo
downloadBooleanoNotrue o falsefalseAtributo
file-sizeEntero positivoCondicional cuando se puede descargarBytes del archivo publicadoNingunoAtributo
summaryTexto simple20–50 palabras; dos oracionesNingunoCuerpo después del primer encabezado
speakersLista de cadenas simplesSí para discurso1–12 hablantes nombrados o etiquetados por rolNingunoMetadatos del cuerpo
chaptersMarca de tiempo y etiqueta repetidasCondicional2–20; obligatorio por encima de 10 minutos cuando cambian los temasNingunoCuerpo
transcriptTexto estructuradoSí para audio editorialDiscurso audible completo y sonidos significativosNingunoCuerpo
consent-categoryEnumeración registradaCondicional para proveedor externoUna categoría aprobada por el sitioPolítica del proveedorAtributo
fallback-urlURL HTTPSUna página de episodio canónico o de mediosrc solo cuando es directamente utilizableAtributo

El renderizador debe permitir proveedores y tipos de medio en lista blanca, rechazar HTML incrustable scripteable o arbitrario y escapar las etiquetas de autoría. src identifica la entrega del medio; nunca sustituye al título, resumen o transcripción. El cuerpo asigna su primer encabezado a title, su primer párrafo a summary y las secciones etiquetadas de Hablantes, Capítulos y Transcripción a campos estructurados.

Sintaxis y ejemplos de código

Las tres formas siguientes representan los mismos campos canónicos. Sus URL son valores ilustrativos de especificación, no recursos referenciados por esta página.

Directiva Markdown portátil

:::audio-embed{src="https://media.example.com/episodes/migration-validation.mp3" provider=native variant=chaptered duration=PT14M6S published=2026-08-27 media-type="audio/mpeg" download=false fallback-url="https://example.com/podcast/migration-validation/"}
## Cómo validamos la migración

Un líder técnico explica las comprobaciones utilizadas antes y después del lanzamiento, incluido el umbral de reversión.

Hablantes: Maya Chen, líder técnica; Leon Ward, presentador

Capítulos:
- 00:00 — Línea base y criterios de lanzamiento
- 04:12 — Comprobaciones de redirección y canónicas
- 09:40 — Umbral de reversión

Transcripción:
### Línea base y criterios de lanzamiento
**Leon Ward:** ¿Qué registraron antes del lanzamiento?
**Maya Chen:** Exportamos las URL canónicas, los códigos de estado y la línea base de páginas de aterrizaje orgánicas.
:::

Shortcode de Hugo

La notación de Hugo utiliza solo parámetros con nombre. Documenta el adaptador previsto y no invoca ni afirma que ya exista un shortcode local.

{{< audio-embed src="https://media.example.com/episodes/migration-validation.mp3" provider="native" variant="chaptered" duration="PT14M6S" published="2026-08-27" mediaType="audio/mpeg" download="false" fallbackUrl="https://example.com/podcast/migration-validation/" >}}
## Cómo validamos la migración

Un líder técnico explica las comprobaciones utilizadas antes y después del lanzamiento, incluido el umbral de reversión.

Hablantes: Maya Chen, líder técnica; Leon Ward, presentador

Capítulos:
- 00:00 — Línea base y criterios de lanzamiento
- 04:12 — Comprobaciones de redirección y canónicas
- 09:40 — Umbral de reversión

Transcripción:
### Línea base y criterios de lanzamiento
**Leon Ward:** ¿Qué registraron antes del lanzamiento?
**Maya Chen:** Exportamos las URL canónicas, los códigos de estado y la línea base de páginas de aterrizaje orgánicas.
{{< /audio-embed >}}

El adaptador debe renderizar <audio controls preload="metadata"> para medios nativos, añadir <source type="audio/mpeg">, e incluir texto alternativo y un enlace normal dentro del elemento de audio. Un proveedor externo debe cargarse solo según el comportamiento de consentimiento declarado y no debe recibir atributos de iframe arbitrarios proporcionados por el autor.

Bloque de WordPress

<!-- wp:amicited/audio-embed {"src":"https://media.example.com/episodes/migration-validation.mp3","provider":"native","variant":"chaptered","duration":"PT14M6S","published":"2026-08-27","mediaType":"audio/mpeg","download":false,"fallbackUrl":"https://example.com/podcast/migration-validation/"} -->
<h2>Cómo validamos la migración</h2>
<p>Un líder técnico explica las comprobaciones utilizadas antes y después del lanzamiento, incluido el umbral de reversión.</p>
<p data-speakers>Maya Chen, líder técnica; Leon Ward, presentador</p>
<ol data-chapters><li><time datetime="PT0S">00:00</time> — Línea base y criterios de lanzamiento</li><li><time datetime="PT4M12S">04:12</time> — Comprobaciones de redirección y canónicas</li><li><time datetime="PT9M40S">09:40</time> — Umbral de reversión</li></ol>
<section data-transcript><h3>Línea base y criterios de lanzamiento</h3><p><strong>Leon Ward:</strong> ¿Qué registraron antes del lanzamiento?</p><p><strong>Maya Chen:</strong> Exportamos las URL canónicas, los códigos de estado y la línea base de páginas de aterrizaje orgánicas.</p></section>
<!-- /wp:amicited/audio-embed -->

Los atributos guardados de WordPress y la salida renderizada en el servidor deben preservar la misma duración, hablantes, capítulos y transcripción. El editor puede previsualizar una forma de onda, pero la forma de onda no sustituye a un control de búsqueda etiquetado ni a la navegación textual.

Ejemplos

Bueno: una grabación que sigue siendo útil sin sonido

Por qué el equipo estableció una ventana de reversión de 30 minutos
Priya Shah, gerente de lanzamientos, explica las condiciones observables que detendrían la migración. Duración: 2:18.
Capítulos: 00:00 — Responsable de la decisión · 00:42 — Condiciones de parada · 01:31 — Orden de recuperación
Extracto de transcripción: Priya Shah: «El reloj no era el desencadenante por sí mismo. Retrocederíamos si los errores de pago superaban el umbral acordado y el nuevo lanzamiento era la causa confirmada».
Grabado el 21 de agosto de 2026 · Transcripción completa a continuación

Esto es bueno porque el título expresa una decisión, el rol del hablante establece relevancia, los capítulos hacen navegable un clip corto y la transcripción preserva la calificación exacta: el tiempo transcurrido por sí solo no fue el desencadenante. Un lector y un rastreador pueden entender la evidencia sin cargar medios. El elemento no fabrica una estadística ni separa la cita de su contexto.

Malo: un reproductor promocional opaco

¡Escucha ahora!
▶ Episodio 47
El secreto que lo cambia todo.

Esto es malo porque el título no promete nada verificable, el hablante y el tema están ausentes, y «Episodio 47» tiene significado solo para un suscriptor existente. No hay duración, transcripción, fecha, atribución, navegación por capítulos ni ruta de fallo. Si el widget externo está bloqueado, la página pierde toda su sustancia. El teaser exagerado también oculta si la grabación es evidencia, instrucción, opinión o publicidad.

Marcado de esquema y accesibilidad

Los datos estructurados describen el medio; no hacen que el audio sea indexable. Usa AudioObject solo para audio reproducible, con name, description, URL, duration, uploadDate y detalles de codificación precisos cuando se conozcan. Usa PodcastEpisode solo para un episodio genuino y conéctalo a su serie mantenida. Un extracto de entrevista no es un episodio. La página contenedora conserva su tipo primario apropiado.

No conviertas la opinión de un hablante en una calificación de reseña, una declaración de cliente en un resultado no verificado, ni una fecha de publicación en una fecha de grabación. Adjunta las referencias de investigación en la transcripción y usa un bloque de fuentes en lugar de esperar que los metadatos del medio establezcan credibilidad.

La accesibilidad comienza con contenido equivalente. La transcripción debe incluir todas las palabras habladas que tengan significado, identificar a los hablantes siempre que el cambio de voz no sea obvio en el texto, y describir audio importante no verbal como [suena una alarma] o [pausa larga] cuando afecte la interpretación. Edita la transcripción automática comparándola con la grabación. Preserva los falsos comienzos o incertidumbres significativos, pero elimina los rellenos solo bajo una política editorial divulgada que no cambie el significado.

Usa controles nativos donde cumplan con el requisito de navegador compatible, o asegúrate de que cada control personalizado sea operable con teclado, tenga foco visible, esté etiquetado y exponga su nombre, rol, valor y estado. Los usuarios necesitan reproducir y pausar, buscar, tiempo transcurrido y total, volumen o silencio cuando corresponda, y una forma de detener el audio inmediatamente. Se recomienda un control de velocidad de reproducción para discursos de más de cinco minutos. No te bases únicamente en una forma de onda: no comunica ni la posición ni el significado del capítulo a muchos usuarios.

Nunca reproduzcas audio editorial automáticamente. No robes el foco cuando el reproductor se inicialice y preserva el foco si una fachada de consentimiento se convierte en reproductor. Anuncia errores sin anunciar repetidamente el tiempo de reproducción. Los marcos externos necesitan títulos descriptivos, dimensiones reservadas y un enlace alternativo normal. La transcripción, el resumen y los capítulos deben funcionar con zoom al 200 %, navegación por teclado y sin JavaScript ni almacenamiento de terceros.

Reglas de redacción

Redacta el texto circundante para que el lector pueda decidir si escuchar y recuperar la sustancia de la grabación sin necesidad de escucharla.

  • Mantén el título entre 4 y 14 palabras y haz que identifique el tema o la decisión, no meramente «Podcast» o «Escucha ahora».
  • Mantén el resumen entre 20 y 50 palabras en no más de dos oraciones. Nombra al hablante o formato, el tema y el valor de escuchar.
  • Muestra la duración fuera del reproductor en m:ss por debajo de una hora o h:mm:ss a partir de una hora. Almacena el valor legible por máquina como ISO 8601.
  • Nombra de 1 a 12 hablantes o usa etiquetas de rol estables como «Presentador» e «Interlocutor» cuando la privacidad o la fuente impidan la publicación de un nombre.
  • Añade de 2 a 20 capítulos cuando una grabación de más de diez minutos cambie de tema. Mantén las etiquetas entre 3 y 10 palabras y coloca el primer capítulo en 00:00.
  • Publica una transcripción completa para discurso editorial. Un resumen, citas seleccionadas, archivo de subtítulos o texto generado por el proveedor disponible solo después de la reproducción no califica.
  • Usa párrafos cortos en la transcripción, etiquetas de hablante en negrita, encabezados descriptivos para cambios de tema y marcas de tiempo al menos en cada límite de capítulo.
  • Verifica nombres, marcas, URL, números, unidades, negaciones y terminología especializada comparando con la grabación y el material fuente.
  • Indica si un extracto está acortado o reordenado. Marca las omisiones; nunca combines palabras en una oración que el hablante no dijo.
  • Usa una introducción neutral y específica. Evita vacíos de curiosidad, falsa urgencia y afirmaciones de que el episodio es «esencial» o «revolucionario».
  • Nunca coloques publicidad en controles entre segmentos, un muro de correo electrónico, un flujo de cuenta forzado, seguimiento oculto, una bandera de reproducción automática, HTML iframe sin procesar ni botones de suscripción no relacionados dentro del elemento central.
  • No publiques conversaciones privadas, música sin licencia, detalles confidenciales de clientes ni la grabación de un hablante sin permiso documentado y la revisión requerida.

Tipos de publicación que lo utilizan

Esta tabla se basa en la lista postTypes registrada en el front matter.

Tipo de publicaciónFunción de la incrustación de audioUbicación típica
Recopilación de expertosPreserva la expresión oral del experto y su respuesta completa, mientras que la transcripción facilita la comparación entre colaboradoresDespués del contexto escrito del colaborador, antes de la síntesis editorial
Caso de estudioAporta el testimonio del cliente o del equipo de implementación sin reemplazar la evidencia medidaDespués del resultado relevante y la atribución
Investigación originalPublica una entrevista metodológica, grabación de campo o comentario del investigador junto con los datosDespués del método o hallazgo que aclara
Artículo de documentaciónOfrece orientación narrada opcional o pronunciación mientras los pasos escritos siguen siendo autoritativosDespués de la instrucción y el resultado esperado
Página de reseñaDemuestra la calidad del sonido o preserva el comentario del evaluador con condiciones divulgadasJunto al criterio evaluado y el veredicto escrito
Perfil de empresaAñade una entrevista atribuible del fundador, liderazgo o archivo a un perfil factualDespués de que la identidad y el contexto establezcan por qué el hablante es relevante

Lista de verificación de control de calidad

  • Escuchar la grabación aporta evidencia, contexto, pronunciación, emoción o conveniencia auditiva que justifica un elemento de audio.
  • El título, resumen, duración, hablantes, fecha y relación con la página son claros antes de la reproducción.
  • La transcripción completa y editada está presente en el HTML inicial renderizado en el servidor y no requiere reproducción, consentimiento, inicio de sesión ni JavaScript.
  • La transcripción coincide con la edición final publicada y preserva correctamente nombres, números, negaciones, incertidumbre y cambios de hablante.
  • Los extractos revelan omisiones o reorganización y no combinan declaraciones separadas en una cita engañosa.
  • Las grabaciones de más de diez minutos con múltiples temas tienen capítulos descriptivos y precisos mapeados a los encabezados de la transcripción.
  • El comportamiento de reproducir, pausar, detener, buscar, tiempo, volumen, foco y velocidad de reproducción funciona con teclado y tecnología de asistencia según corresponda.
  • El audio nunca se reproduce automáticamente, y activar o reemplazar una fachada de consentimiento no pierde el foco.
  • Un proveedor bloqueado o una solicitud de medio fallida deja utilizables el resumen, la transcripción, la atribución, la duración y el enlace alternativo canónico.
  • Las solicitudes a proveedores externos siguen la política de consentimiento del sitio, y la divulgación nombra al proveedor antes de que se envíen datos cuando sea requerido.
  • Las fuentes nativas devuelven el tipo de medio declarado, admiten el comportamiento de búsqueda esperado y no fuerzan una descarga a menos que el usuario la elija.
  • Los enlaces de descarga indican el formato y el tamaño aproximado; no se hace referencia a imágenes de portada no aprobadas o inexistentes.
  • Los datos de AudioObject o PodcastEpisode, cuando están presentes, describen la grabación reproducible exacta y coinciden con los hechos visibles.
  • El elemento no tiene un reproductor competidor adyacente, anuncio sonoro, formulario de captación de leads ni llamada a la acción de alta prioridad.
  • El diseño móvil no se desborda; los controles siguen siendo utilizables al 200 % de zoom y con texto grande.
  • El permiso de publicación, la licencia de música, la revisión de privacidad y la revisión factual están registrados cuando el contenido los requiere.

Preguntas frecuentes

Las preguntas anteriores abordan la integridad de la transcripción, la reproducción automática, el comportamiento de divulgación, la elección del esquema y el fallo del proveedor. Sus respuestas están registradas en el front matter para que la plantilla de Academy pueda renderizarlas de manera coherente mientras este cuerpo sigue siendo la especificación de implementación.

← All SEO Playbook guides

¿Listo para ponerlo en práctica?

Revisión gratuita · Prueba de 7 días · sin tarjeta de crédito