Le mois dernier, j'ai essayé de faire quelque chose qui s'est avéré bien plus difficile que d'écrire du code.
Trouver un bon produit.
Pas juste une idée intéressante qui semble cool à un développeur, mais un produit pour lequel il existe un vrai marché et des gens prêts à payer.
Et plus j'y pense, plus je suis convaincu : écrire un MVP est souvent plus simple que de comprendre ce qu'il faut écrire.
Tout a commencé avec la transcription
Au départ, je voulais créer un service de transcription audio et vidéo.
L'idée semblait logique : télécharger une vidéo, obtenir une transcription textuelle dans un format pratique, puis en un clic faire un résumé du contenu.
D'autant plus que la demande pour ce service existe réellement. Par exemple, la requête « vidéo en texte » dans Yandex Wordstat montre environ 30 000 requêtes par mois.
J'ai même réussi à coder un premier MVP : j'ai fait un site, un backend et connecté mes réseaux de neurones.
On pourrait croire que voilà le produit.
Mais quand j'ai commencé à regarder le marché de plus près, j'ai eu l'impression d'être un peu en retard. Il existe déjà énormément de services de transcription, et beaucoup font à peu près la même chose.
Et j'ai commencé à me poser une question assez désagréable :
Pourquoi quelqu'un aurait-il besoin d'un autre transcribeur ?
On peut rendre l'interface plus belle, ajouter un autre réseau de neurones ou inventer quelques fonctionnalités supplémentaires. Mais tout cela commençait à ressembler à une tentative de justifier l'idée choisie, plutôt qu'à une recherche de besoin réel.
De la transcription à la vidéo courte
À un moment donné, j'ai commencé à penser non pas à la transcription elle-même, mais à ce que les gens font du texte obtenu.
C'est ainsi que je suis arrivé aux vidéos courtes.
Reels, Shorts, TikTok et autres formats verticaux ont depuis longtemps transformé les sous-titres en un élément de design à part entière. Ce n'est plus simplement du texte en bas de l'écran.
De grands mots, la mise en évidence de certaines phrases, l'animation, le changement de taille et de couleur, le placement du texte à côté des objets dans le cadre — tout cela aide à retenir l'attention du spectateur.
C'est ainsi qu'est née l'idée de créer un service non pas pour la transcription, mais pour la création et l'édition de sous-titres percutants pour les vidéos courtes.
Et c'est un tout autre produit.
Au début, l'idée semblait simple : reconnaître la parole, obtenir des codes temporels et donner à l'utilisateur un éditeur pratique.
Mais plus j'y pensais, plus il y avait de possibilités :
- détecter les objets dans le cadre et ne pas les recouvrir avec les sous-titres ;
- mettre automatiquement en évidence les mots importants ;
- ajouter des animations ;
- adapter le style à la vidéo spécifique ;
- trouver les moments qui méritent d'être soulignés visuellement.
Et ensuite, l'imagination du développeur s'emballe : B-roll, montage automatique, synchronisation labiale, travail sur la piste audio, montage vidéo avec un agent IA.
À un moment donné, j'ai compris qu'il était très facile d'imaginer un produit pour les cinq prochaines années.
J'ai donc décidé de m'arrêter et de commencer par quelque chose de beaucoup plus simple :
Faire un bon éditeur de sous-titres.
Ce qui en est ressorti
C'est ainsi qu'est né mon premier SaaS — Captions Space.
L'idée principale du service est simple : télécharger une vidéo, obtenir automatiquement des sous-titres et les mettre rapidement en forme.
Le service reconnaît la parole et crée des sous-titres avec des codes temporels. Ensuite, la vidéo peut être ouverte dans l'éditeur.
Si la reconnaissance a fait une erreur quelque part, le texte peut être corrigé immédiatement. Si le sous-titre apparaît trop tôt ou trop tard, on peut modifier le timing.
Autrement dit, l'IA effectue la partie répétitive du travail, et l'humain vérifie et édite rapidement le résultat.
Et pour moi, c'est un principe de produit assez important :
L'IA ne doit pas nécessairement tout faire toute seule. Parfois, il est plus utile d'automatiser 80 % du travail ennuyeux et de laisser à l'humain les 20 % restants, là où le contrôle et la prise de décision sont nécessaires.
Pourquoi un simple éditeur de texte ne suffit pas
Une partie distincte du projet est le style.
Si l'on regarde les Reels et Shorts populaires, on remarque que les sous-titres y sont souvent une partie intégrante du style visuel de la vidéo.
Il ne suffit donc pas de donner à l'utilisateur la possibilité de corriger le texte.
Il faut pouvoir gérer la police, la taille, la couleur, la mise en évidence des mots, le fond, le contour, le nombre de lignes et l'emplacement du texte. Et il est peu probable que quelqu'un veuille tout configurer à partir de zéro pour chaque vidéo.
J'ai donc ajouté des styles prêts à l'emploi :
- Minimal — une option simple et minimaliste ;
- Beauty — un style plus expressif ;
- Business — un style sobre pour le contenu professionnel.
On choisit l'option appropriée, on modifie quelque chose si nécessaire — et on peut continuer le travail.
Au final, le scénario de base ressemble à ceci :
Vidéo → reconnaissance → sous-titres → édition → style → vidéo finale.
La partie la plus difficile — savoir s'arrêter à temps
Pour l'instant, ce n'est que la première version du produit.
J'essaie délibérément de ne pas en faire un couteau suisse avec une centaine de fonctions IA, même si la tentation est très grande.
Si l'on commence à considérer la vidéo comme un ensemble de données, les possibilités sont vraiment énormes :
- analyser non seulement la parole, mais aussi l'image ;
- comprendre ce qui se trouve dans le cadre ;
- déterminer la position de la personne ;
- choisir un espace libre pour les sous-titres ;
- prendre en compte le contexte de ce qui est dit ;
- changer le style en fonction du contenu ;
- trouver les moments importants ;
- ajouter du B-roll.
À terme, on pourrait même abandonner l'éditeur vidéo classique et permettre à l'utilisateur d'écrire simplement :
« Fais de cette vidéo un Reels dynamique dans le style de ma chaîne ».
Et obtenir ensuite un résultat prêt à l'emploi.
Mais c'est déjà l'étape suivante.
Pour l'instant, ce qui m'intéresse le plus, c'est de tester une hypothèse plus simple :
Les gens ont-ils besoin d'un outil pratique pour créer et éditer des sous-titres ?
Parce que c'est là que commence le vrai produit. Pas avec le nombre de fonctions IA, mais avec le fait de savoir s'il résout un problème concret et si les gens sont prêts à y revenir.
Donc pour l'instant, je fais, j'essaie et je regarde ce que ça donne.
C'est mon premier SaaS en solo, et je suis moi-même curieux de parcourir tout le chemin : de l'idée et des premières lignes de code aux premiers utilisateurs et, peut-être, aux premiers revenus.
Si vous avez créé votre propre SaaS ou lancé un MVP, racontez dans les commentaires : comment avez-vous compris que vous aviez trouvé un besoin réel, et pas simplement une idée intéressante pour vous-même ?
Vous pouvez suivre le développement du projet sur ma chaîne Telegram : @imironov
Le projet lui-même : Captions Space
Commentaires
0Aucun commentaire pour le moment.
Connectez-vous pour participer à la discussion.