AIScriptwritingVideo

Comment scripter des vidéos courtes avec l'IA (Reels, TikTok)

Demande à l'IA le squelette accroche-valeur-CTA, puis écris toi-même les détails et le ton. Système de blocs de 15 secondes pour Reels, TikTok et Shorts.

Dan — Founder, SocialKit10 min read

Scripter des vidéos courtes avec l'aide de l'IA, ça veut dire confier au modèle le travail de structure — le squelette accroche-valeur-CTA, le découpage en blocs, trois angles différents sur la même idée — et garder pour toi ce qui rend la vidéo unique : l'exemple précis, le chiffre dont tu peux personnellement te porter garant, la façon dont la phrase sonne quand elle sort de ta bouche. Le modèle est un faiseur de plans rapide, pas l'auteur de tes phrases. Utilisé comme ça, un script de 45 secondes qui te dévorait vingt minutes t'en prend environ quatre — et c'est ce qui rend réaliste le fait de scripter cinq vidéos d'affilée en une seule séance.

C'est délibérément l'approche inverse de notre guide sur l'écriture d'un script YouTube à la main, qui parle d'artisanat du format long : installer le contexte, doser la densité d'information sur huit minutes, planter des relances d'attention. La vidéo courte est une autre bête. Il n'y a pas la place d'installer quoi que ce soit. La structure est assez rigide pour qu'un modèle produise un squelette utilisable en quelques secondes, et assez rigide pour que le squelette soit la partie la moins précieuse.

Ce que l'IA fait vraiment bien ici — et ce qu'elle saccage

Sépare le travail en deux avant même d'ouvrir une fenêtre de prompt.

L'IA fait bien l'échafaudage. La structure en blocs, la forme d'une accroche, dix angles sur un sujet que tu n'as regardé que sous un seul, la condensation d'un paragraphe bavard en une phrase qu'on peut dire à voix haute, et — la plus sous-estimée — le fait de te dire quand ton idée contient trop d'idées. Demande à un modèle de compresser un concept de 60 secondes en 30 secondes : il coupera sans pitié, d'une façon dont la plupart des créateurs sont incapables avec leur propre travail.

L'IA saccage la précision et l'interprétation. Laissée seule, elle produit le script parfaitement générique : « Dans cette vidéo, je vais te montrer trois astuces pour faire grandir ton compte. » Elle invente des statistiques si tu la laisses faire. Elle écrit des phrases équilibrées et bien rangées que personne ne prononce à voix haute. Et elle n'a aucun accès à ce qui fait réellement fonctionner la vidéo courte — le client qui t'a appelé à 23 h, la facture que tu as ratée, le prix exact que tu as payé.

D'où la règle à laquelle je me tiens : le modèle propose la structure, tu fournis les preuves et la voix. Chaque prompt ci-dessous est construit pour garder cette frontière nette.

Écris par blocs de 15 secondes

La rétention en vidéo courte se joue par blocs, pas par paragraphes. L'unité pratique tourne autour de 15 secondes — assez longue pour faire passer une idée, assez courte pour que l'attention du spectateur ne parte pas en cours de route. Écris sur une grille de blocs et tes scripts arrêtent de s'étaler.

Pour une vidéo de 45 secondes :

TimecodeBlocRôle
0:00–0:03AccrocheNomme le problème ou le bénéfice. Pas de salutation, pas de logo, pas de « salut à tous ».
0:03–0:15Mise en placePose l'enjeu et promets ce qui arrive. Une phrase de contexte, maximum.
0:15–0:30ValeurLe vrai contenu. Une démo, un chiffre, une étape, un avant/après.
0:30–0:45Résolution + CTAReferme la boucle ouverte par l'accroche, puis une seule demande précise.

Deux règles tiennent l'ensemble. D'abord, chaque bloc doit se terminer par une raison de rester — une réponse partielle, une comparaison en suspens, un « mais voilà la partie qui a cassé ». Ensuite, l'accroche n'est pas un bloc qu'on écrit en dernier comme décoration ; tout le script existe pour honorer la promesse que fait l'accroche. Notre décryptage de ce qui doit se passer dans les trois premières secondes couvre la mécanique, et la bibliothèque de formules d'accroche te donne les schémas sous-jacents qu'il vaut la peine d'injecter dans un prompt comme angles nommés, plutôt que d'espérer que le modèle les invente.

Pour une vidéo de 30 secondes, supprime le bloc de mise en place. Pour 60 secondes, ajoute un deuxième bloc de valeur — jamais une mise en place plus longue. Rallonger le début est de loin la façon la plus courante de perdre des spectateurs en vidéo courte, et la courbe de rétention le montre sans ambiguïté, comme le creusent nos guides sur la durée de visionnage TikTok et la rétention des Reels.

Le prompt de base

Commence chaque script par la même demande squelette, puis intercale en dessous le bloc propre à ton format.

Tu m'aides à scripter une vidéo courte verticale pour [plateforme]. Sujet : [une phrase]. Audience : [précise — pas « les petites entreprises » mais « les photographes de mariage indépendants qui font 15 mariages par an »]. Mon angle : [la chose non évidente que je crois].

Écris un script de 45 secondes sur cette grille de blocs : 0–3 s accroche, 3–15 s mise en place, 15–30 s valeur, 30–45 s résolution et CTA. Règles :

  • Langue parlée uniquement. Phrases courtes. Registre oral, formes contractées comprises. Aucune phrase de plus de 14 mots.
  • Aucune statistique, étude ou résultat inventé. Là où un chiffre précis a sa place, écris [CHIFFRE] et je le remplirai.
  • Pas de salutation, pas de « dans cette vidéo », pas de formule de fin.
  • Marque chaque bloc avec son timecode et un nombre de mots approximatif.
  • Donne-moi trois accroches différentes pour le même script, sous trois angles différents.

Puis liste ce dont tu aurais besoin de ma part pour le rendre précis.

Cette dernière ligne fait plus de travail que tout le reste du prompt réuni. Le modèle revient en te réclamant l'histoire du client, le prix, l'erreur — c'est-à-dire exactement la matière que tu t'apprêtais à sauter. Pour un jeu plus large de structures de prompt réutilisables, notre article sur les frameworks de prompt pour les réseaux sociaux couvre le même schéma « contraindre puis remplir » appliqué à d'autres formats.

Un bloc de prompt par format

Face caméra

Ajoute :

C'est une prise continue face caméra. Écris-le pour que je le lise à voix haute, pas pour que je le joue. Prévois une coupe franche toutes les 4 à 6 secondes — marque chacune par [CUT] là où la phrase se coupe naturellement, pour que le montage puisse retirer les pauses sans casser une phrase. Propose une ligne de texte à l'écran par bloc, six mots maximum.

Le face caméra vit ou meurt sur le rythme des coupes. Marquer les coupes dans le script, ça veut dire que tu tournes en prises courtes et que tu n'as jamais à rattraper une prise bavarde au montage.

Voix off sur du b-roll

Pour une narration posée sur du b-roll, ajoute :

Écris ceci comme une narration posée sur des images. Sors deux colonnes : la ligne de voix off, et le plan qui passe dessous. Chaque plan doit être filmable au téléphone en moins de deux minutes — pas de banque d'images, pas de drone, pas de studio. Là où la voix off avance une affirmation, le plan doit la montrer, pas la décorer.

C'est la contrainte « montre-la, ne la décore pas » qui t'évite de récupérer un script dont la colonne visuelle affiche « personne qui tape sur un ordinateur portable, souriante » pour les quatre blocs.

Tutoriel ou capture d'écran

Ajoute :

C'est une capture d'écran de [outil/processus]. Écris la voix off sous forme d'étapes numérotées. Chaque étape : une action, une raison. Annonce le résultat dans l'accroche avant de montrer la moindre étape. Signale l'unique étape où les gens se trompent habituellement et donne-lui son propre bloc. Trois étapes au maximum au total.

Trois étapes maximum, c'est ça la discipline. Un tutoriel en cinq étapes tenu en 45 secondes est un flou que personne ne peut suivre, et sa place est plutôt dans un carrousel ou une vidéo longue.

La passe humaine, en quatre minutes

Ne filme jamais le brouillon du modèle. Fais-le passer par ceci :

  • Remplace chaque [CHIFFRE] et chaque [EXEMPLE] par quelque chose de vrai. Si tu ne peux pas en remplir un honnêtement, coupe la phrase plutôt que de l'adoucir en affirmation vague.
  • Lis-le une fois à voix haute. Partout où tu butes, réécris. Partout où tu n'emploierais jamais le mot — « tirer parti de », « utiliser », « dans le but de » — remplace-le par celui que tu dirais vraiment.
  • Chronomètre. Lis à ton vrai débit de parole, chronomètre en main. La plupart des brouillons IA de 45 secondes en font 55 une fois dits à voix haute. Coupe dans la mise en place, jamais dans la valeur.
  • Réécris toi-même la première ligne. Prends la plus forte des trois accroches générées comme matière brute, puis affûte-la à la main — la même boucle « filtrer puis affûter » décrite dans notre méthode de génération d'accroches par l'IA. La ligne d'ouverture est la seule phrase du script qui mérite toute ton attention.
  • Vérifie que le CTA est unique et précis. « Commente SETUP et je t'envoie la checklist » bat « abonne-toi pour la suite ». Un seul appel à l'action, un seul verbe.

Scripte-en cinq, filme une fois, programme partout

Si on cherche à scripter vite, c'est parce que ça débloque le travail par lots. Une seule séance de 90 minutes couvre, de façon réaliste : 20 minutes pour générer et affûter cinq scripts, 40 minutes pour filmer les cinq d'affilée avec un seul éclairage et une seule tenue, 30 minutes pour monter et programmer. Ça fait quinze jours de vidéo courte sortis d'un seul bloc — la question de cadence que notre guide de stratégie vidéo courte traite comme la vraie variable de croissance. La mécanique plus large de ce mode de travail est dans notre workflow de création de contenu par lots.

Exporte un seul master vertical propre par vidéo au format standard — les specs sont sur notre référence des tailles de Reel — et l'étape de distribution ne coûte presque plus rien. Dans SocialKit, tu téléverses ce master une fois et tu le programmes vers Reels, TikTok et YouTube Shorts depuis un seul composeur, en personnalisant la légende et les hashtags par plateforme plutôt qu'en publiant trois fois le même texte. Les plafonds de légende diffèrent d'un réseau à l'autre ; les nôtres sont listés sur la référence des limites de caractères et vérifiés à mesure que tu tapes.

Pour être clair sur la limite : SocialKit ne monte pas, ne coupe pas et ne recadre pas la vidéo — ça se passe dans ton logiciel de montage avant que le fichier n'arrive chez nous. Ce dont il s'occupe, c'est tout ce qui vient après l'export : un calendrier visuel unique pour le lot, des recommandations de meilleur moment pour publier par plateforme, la publication automatique, et les analytics de publication pour voir laquelle des cinq accroches a gagné la rétention. Les 11 plateformes sont incluses dans toutes les formules, à partir de 29 €/mois sur Solo (17,40 €/mois en facturation annuelle) en date de septembre 2024, avec un essai gratuit de 7 jours.

Par où commencer cette semaine

  1. Choisis cinq sujets que tu peux prouver — cinq choses précises que tu as faites, chiffrées, réparées ou ratées.
  2. Lance le prompt de base une fois par sujet, avec le bloc de format qui correspond à ta façon de tourner.
  3. Fais la passe humaine de quatre minutes sur chacun : remplis les trous, lis à voix haute, chronomètre, réécris l'accroche.
  4. Filme les cinq en une seule séance. Même installation, même éclairage, script sur un téléphone juste sous l'objectif.
  5. Monte, exporte un master 9:16 pour chacune, et programme le lot sur Reels, TikTok et Shorts.
  6. Au bout d'une semaine, regarde où la rétention de chaque vidéo décroche. Si c'est avant cinq secondes, le problème vient de l'accroche. Si c'est en milieu de vidéo, le bloc de mise en place est trop long — et c'est exactement l'instruction que tu resserres au tour de prompts suivant.

Le prompt s'améliore à chaque cycle parce que tu l'alimentes avec ce que tes propres données de rétention t'ont appris. C'est cette boucle, pas le modèle, qui capitalise.