Una voz en off de TikTok es narración grabada aparte de las imágenes y superpuesta a ellas en el montaje. El texto a voz es la narración sintética que TikTok trae de serie: escribes una línea, eliges una voz y la app la lee sobre el vídeo. Los dos hacen el mismo trabajo: cargar con la información para que no tengan que hacerlo las imágenes, lo que deja libre al material para ser interesante por sí mismo.
La mayoría de creadores añaden la voz en off al final, si da tiempo. En realidad es la capa que decide si la gente se queda: un clip mediocre con una voz en off apretada y bien ritmada retiene mejor que unas imágenes preciosas con silencio muerto encima.
Por qué la voz en off es una capa de retención
El tiempo de visualización en TikTok es una negociación continua. Cada segundo, quien mira decide si sigue mirando, y lo que gana esa discusión con más fiabilidad es una frase sin terminar. La voz en off te da un chorro continuo de ellas.
El texto en pantalla no lo consigue igual de bien. Quien mira lee un rótulo en una fracción del tiempo que está puesto, y luego se queda esperando. La voz en off dosifica la información a una velocidad que tú controlas, así que el espectador va siempre ligeramente por detrás y siempre a media idea: es la mecánica que hay debajo de casi toda nuestra guía de retención y tiempo de visualización en TikTok.
También desacopla lo que enseñas de lo que dices. Sin ella, las imágenes tienen que explicarse solas, que es por lo que tantos clips acaban siendo alguien de pie en una cocina describiendo la cocina. Con ella, las imágenes pasan a ser ilustración: graba b-roll desordenado un martes y deja que la narración haga el trabajo estructural más tarde.
Consecuencia práctica: escribe primero la voz en off y graba después para ella. El guion es el vídeo; las imágenes son el papel pintado.
Grabar voz en off limpia con el móvil
No necesitas micrófono. Los micros de los móviles son buenos de verdad hoy en día: lo que hace que el audio de móvil suene amateur es casi siempre la habitación, no el hardware.
Arregla la habitación antes que el equipo
Las superficies duras provocan reflexiones, y las reflexiones son lo que hace que el audio suene a «grabado en una casa». El baño y la cocina son las peores habitaciones que tienes a mano; un armario lleno de ropa es la mejor. Un sofá mullido, un edredón echado por encima de tu cabeza y del móvil, o un coche aparcado con el motor apagado funcionan perfectamente.
Apaga todo lo que zumbe: nevera, campana extractora, aire acondicionado, ventilador del portátil. Pon el móvil en No molestar: la vibración viaja directa al micro a través del cuerpo del teléfono.
Técnica que sí cambia el resultado
- Sujeta el móvil a un palmo de la boca, ligeramente hacia un lado. Hablarle de frente hace que revienten las plosivas; fuera de eje lo arregla sin necesidad de filtro antipop.
- Usa auriculares de cable con micro en el cable si los tienes. Una distancia constante a la boca importa más que la calidad bruta del micro. Los auriculares Bluetooth suelen grabar con un códec de peor calidad: aquí, evítalos.
- Ponte de pie. Cambia tu apoyo respiratorio y tu energía. Encorvado sobre un escritorio, suenas aburrido.
- Graba en la app de notas de voz del móvil, no en la app de edición. Te queda un archivo limpio que puedes retemporizar y volver a cortar sin regrabar.
- Haz dos tomas y quédate con la segunda. La primera toma eres tú encontrando el ritmo.
Interprétalo, no lo leas
El fallo más común es la lectura plana: las frases escritas interpretadas al pie de la letra suenan a nota de prensa. Marca tu guion: qué palabra lleva el significado, dónde va la pausa, dónde aceleras. Luego habla un poco más rápido y con más energía de lo que te sale natural, porque los altavoces de móvil en una sala ruidosa lo aplanan todo y lo que a ti te parece pasarte suena normal en la reproducción.
Después quita las respiraciones en el montaje. Recortar silencios muertos y titubeos de medio segundo es el corte con más rendimiento del vídeo corto, y lo tratamos a fondo en nuestra guía de edición de vídeo para TikTok. Una lectura en bruto de noventa segundos se convierte a menudo en una pieza mucho más apretada sin haber quitado nada más que silencio.
Mezclar con música
La música pone el ambiente y alimenta el bucle de descubrimiento por audio que describe nuestra estrategia de sonidos en TikTok: ese post va de elegir audio que viaje. La voz en off lleva el mensaje. Cuando están las dos, la música se queda claramente por debajo: si tienes que esforzarte para oír las palabras en el altavoz de un móvil a medio volumen, está demasiado alta.
Eso sí, sé honesto con el intercambio: un vídeo sostenido por tu propia voz en off no suele conseguir la misma distribución desde la página del audio que uno montado sobre un sonido en tendencia. Normalmente es un cambio justo para un vídeo denso en valor, pero es un cambio.
Cuándo la voz robótica de TTS gana a la tuya de verdad
El texto a voz de TikTok vive en la herramienta de texto nativa: añades una capa de texto, la tocas, eliges texto a voz y escoges una voz. A fecha de junio de 2026 el catálogo de voces sigue cambiando cada cierto tiempo, así que mira qué hay en tu app en vez de dar por hecho que una voz concreta está ahí.
El replanteamiento importante: el TTS es un formato, no un plan B. Ciertos tipos de contenido se leen como más nativos con una voz sintética que con una humana, porque la audiencia ha aprendido a asociar esa voz con esa clase de vídeo.
| Usa TTS cuando | Usa tu propia voz cuando |
|---|---|
| El contenido es de listas, factual o de estilo «sabías que» | Estás construyendo una marca personal o una relación |
| Escribes en un marco de POV o de personaje en el que un narrador neutro tiene más gracia | El contenido es opinión, historia o experiencia |
| El guion son frases cortas y contundentes que necesitan un timing mecánico | El tono, el sarcasmo y el énfasis llevan el significado |
| Publicas en volumen y la consistencia importa más que la calidez | Quieres que la gente te reconozca de un vídeo a otro |
| Tu acento o tu forma de hablar están frenando de verdad al contenido | La confianza y la autoridad son el objetivo (consejos, coaching) |
Unas cuantas notas honestas. El TTS destroza nombres, siglas y números: escríbelos fonéticamente en la capa de texto y luego borra el texto visible si solo quieres el audio. No sabe hacer sarcasmo, así que los chistes que dependen del tono se mueren. Y la entonación plana que se lee como «TikTok nativo» durante quince segundos agota a los sesenta; nuestra guía de duración de vídeo te ayuda a calibrar hasta dónde estirarla.
La versión más potente suele ser híbrida: TTS para las líneas estructurales que se repiten (el hook, los puntos numerados, la despedida) y tu propia voz para las partes que piden calidez. Patrón reconocible, sin un minuto entero de robot.
Un límite que conviene decir claro: el TTS no es lo mismo que clonar una voz. Una voz generada por IA o clonada —sobre todo si se parece a la de una persona real— te mete en terreno de divulgación, que es justo para lo que existe el etiquetado de contenido con IA de TikTok. Nuestro post sobre divulgación de contenido con IA explica cómo gestionarlo.
La voz en off como columna vertebral de una cuenta sin rostro
Para los creadores sin rostro, la voz en off es el motor de producción. Es lo que te permite separar la escritura del rodaje, que es todo el argumento de eficiencia que hay detrás del formato descrito en nuestra guía de contenido sin rostro. El flujo de trabajo que aguanta a lo largo de meses:
- Escribe diez guiones de una sentada. Estructúralos —hook, tensión, recompensa— con los patrones de nuestra guía de storytelling en TikTok. Los guiones son baratos; las imágenes no.
- Graba las diez voces en off en una sola sesión, misma habitación, misma hora del día. Un sonido consistente es un activo de marca para una cuenta sin rostro igual que lo es una paleta de color. Diez lecturas cortas te llevan menos de una hora.
- Monta primero el audio y luego busca imágenes que encajen. Cuando la voz en off está apretada sabes exactamente cuántos segundos de b-roll necesita cada beat, mucho más rápido que montar la imagen y luego ir a la caza de narración que le cuadre.
- Incrusta subtítulos y revísalos. Los subtítulos automáticos pillan casi todo, pero la transcripción destroza la jerga y los nombres de producto, y una palabra mal puesta en pantalla se carga todo lo demás.
La firma sonora importa más de lo que la gente espera. Una cuenta que siempre usa la misma voz, el mismo ritmo y la misma frase de entrada se vuelve reconocible sin cara. Ir rotando tres voces de TTS en una semana deshace justo eso.
Meter las voces en off por lotes en tu flujo de publicación
La voz en off se acaba saltando porque se trata como una tarea por vídeo. De una en una, preparar la habitación y sacar una toma utilizable cuesta más de lo que vale el vídeo. De diez en diez, cuesta minutos por pieza.
Así que hazlo por lotes como todo lo demás. Escribe los guiones y los captions de la plataforma en la misma sentada: es el mismo acto de escribir, y el caption suele ser una versión comprimida del hook de la voz en off. Nuestra guía para escribir captions en TikTok y el flujo de trabajo de creación de contenido por lotes, más amplio, encajan aquí.
Luego saca el lote terminado del carrete y mételo en una programación. SocialKit es donde pongo los míos: compones una vez, personalizas el caption y los hashtags por plataforma para que la versión de TikTok no se lea igual que la de Shorts, y lo pones todo en cola en un calendario de contenido visual con autopublicación. Para ser claros con lo que no hace: nada de edición de vídeo, nada de reencuadre automático, nada de generación de voz en off. Grabar y montar pasa en tu editor; SocialKit toma el relevo cuando el archivo ya está terminado.
Empieza por aquí
Si la voz en off todavía no forma parte de tu proceso, no reformes nada. Haz esto una vez:
- Escribe guiones de voz en off para cinco ideas de vídeo que ya tengas. De treinta a sesenta segundos de habla cada uno, hook en la primera línea.
- Encuentra tu sitio de grabación. Armario, coche o rincón mullido. Prueba una toma en el altavoz del móvil, no con auriculares: así es como lo va a oír tu audiencia.
- Graba los cinco en una sola sesión. Dos tomas de cada uno, quédate con la segunda, el móvil en No molestar.
- Deja el audio bien apretado antes de tocar las imágenes. Quita cada respiración y cada titubeo.
- Haz que uno de los cinco sea una versión con TTS del mismo guion y compara qué sensación da cada uno. Esa única comparación vale más que cualquier cantidad de teoría.
- Programa el lote terminado en vez de publicar de uno en uno, para que la semana esté hecha antes del lunes.
El objetivo no es un audio de calidad de emisión. Es una voz lo bastante clara para seguirla, lo bastante bien ritmada para retener y lo bastante consistente para reconocerla, producida lo bastante barata como para que sigas haciéndolo.