Le premier benchmark aurait pu suivre le chemin habituel : collecter quelques exports, produire une trentaine de slides, présenter les résultats puis ranger les fichiers. Nous avons choisi une autre voie. Construire le terrain, garder les définitions, historiser les snapshots et transformer l’analyse en une machine capable de produire la prochaine étude avec moins de friction et plus de contexte.
01 — Le point de départ : un benchmark TikTok Shop / Beauty
Le sujet initial est concret : comprendre le social commerce Beauty sur TikTok Shop, principalement en France et en Europe, avec une comparaison internationale. Le terrain couvre la France, le Royaume-Uni, l’Allemagne, l’Espagne, l’Italie et les États-Unis. Il faut regarder le marché, les catégories, les boutiques, les produits, les créateurs et les contenus, sans demander au lecteur de connaître l’écosystème à l’avance.
Cette contrainte est productive. Elle force à faire apparaître les définitions, les dénominateurs, les périodes et les limites. Un chiffre n’est pas encore une information lorsqu’on ne sait pas à quoi il est rapporté, quel périmètre il couvre et s’il s’agit d’un fait observé ou d’une estimation.
02 — Le piège : livrer une étude et perdre le système
Une étude traditionnelle a une forme rassurante : une source, un fichier de travail, quelques analyses, une histoire, un PowerPoint. Elle peut être très bonne et pourtant laisser peu de capital derrière elle. Au mois suivant, il faut retrouver les exports, reconstruire les agrégats, vérifier les définitions et réexpliquer les choix de segmentation.
La limite n’est pas le format de restitution. Un PDF ou un deck reste utile. La limite est de traiter le livrable comme la fin du projet, alors qu’il devrait être un output versionné d’un pipeline durable. L’actif est plus large : dataset, moteur analytique, méthode, historique, storytelling et capacité de répétition.
03 — Construire le terrain : distinguer les objets
Le dataset principal actuel compte 95 955 observations, au grain mois × pays × catégorie L1 × shop. Il comprend 29 728 shop_id uniques observés, six pays, 28 catégories L1 et cinq mois actuellement présents. Ces nombres ne sont pas interchangeables : 95 955 est un volume longitudinal d’observations ; 29 728 est un nombre d’entités uniques dans le panel.
Une boutique peut apparaître sur plusieurs périodes ou plusieurs catégories. Cette distinction paraît technique, mais elle change les conclusions : compter des lignes comme des shops gonflerait artificiellement la couverture ; compter des shops comme des observations ferait disparaître la profondeur temporelle.
mois × pays × catégorie × shop
shop_id uniquesentités observées
6 pays · 5 mois présents
Pour les analyses détaillées Beauty France, le panel descend jusqu’à 200 shops, 1 397 produits — Top 10 remonté par shop —, 1 950 relations créateur × shop, 1 952 vidéos et 1 903 lives. Un dataset créateurs complémentaire compte 500 créateurs uniques, dont 445 taggés Beauty. Ces panels détaillés répondent à des questions différentes du dataset longitudinal ; ils doivent rester nommés comme tels.
04 — Ajouter le temps : du snapshot à la trajectoire
Un classement statique donne une photographie. Les snapshots mensuels permettent d’observer un régime de croissance, une rupture, une accélération ou une saisonnalité. L’historique démarre progressivement en janvier 2026 et doit continuer à s’étendre : la cible de six mois et plus n’est pas présentée comme déjà acquise.
Certaines sources sont aussi disponibles au jour. Cette granularité sert à isoler un pic de campagne, une anomalie de contenu ou un changement brutal de shop. Elle ne remplace pas le mensuel : elle répond à une autre échelle de lecture.
Deux trajectoires du panel illustrent pourquoi le temps compte : Musc Intime progresse d’environ ×27 entre février et juin ; medicube France d’environ ×114 entre mars et juin. Ces valeurs sont des observations du panel, pas une loi de marché. Elles montrent surtout ce qu’un classement de juin aurait masqué : la vitesse et le moment du changement.
05 — Descendre les échelles sans perdre l’histoire
La storyline suit une progression volontaire :
L’étage macro répond à la taille du terrain. La catégorie révèle des structures qui peuvent différer d’un pays à l’autre. Le shop permet de lire la concentration, le modèle de distribution et le portefeuille. Les produits montrent les zones de prix et la dépendance à quelques références. Créateurs et contenus aident enfin à comprendre les mécaniques d’activation visibles.
Le lecteur doit sentir une descente progressive, pas une succession de dashboards : échelle, structure, rythme, acteurs, leviers, décision. La donnée devient une histoire parce que l’ordre des questions est construit avant l’ordre des graphiques.
06 — Insight #1 : les marchés n’ont pas la même échelle
Sur janvier—juin 2026, le GMV TikTok Shop estimé atteint environ 8 972 M€ aux États-Unis, 1 568 M€ au Royaume-Uni, 285 M€ en Allemagne, 210 M€ en France, 168 M€ en Espagne et 150 M€ en Italie. La France, l’Allemagne, l’Espagne et l’Italie réunies représentent environ 812 M€ : les États-Unis pèsent environ onze fois ce périmètre continental observé et le Royaume-Uni environ 1,9 fois.
Ce n’est pas un classement des pays « gagnants ». C’est un rappel méthodologique : les comparaisons doivent conserver leur unité, leur période et leur dénominateur. Une opportunité de marché ne se lit pas seulement en valeur absolue, mais aussi en rythme, en structure et en mécanique de distribution.
07 — Insight #2 : même catégorie, structures différentes
La Beauty représente une part relativement stable du GMV selon les marchés observés — environ 18,4 % aux États-Unis, 19,9 % au Royaume-Uni, 15,6 % en Allemagne, 18,1 % en France, 15,7 % en Espagne et 17,8 % en Italie. La catégorie n’est donc pas un détail marginal ; elle apparaît comme une composante structurelle du social commerce sur ces marchés.
Mais stabilité de la part ne veut pas dire identité de la structure. Au Royaume-Uni, Skincare + Makeup représentent environ 50 % du GMV Beauty. En Allemagne, Espagne et Italie, Personal Care Appliances + Fragrance pèsent environ 44—46 %. La France apparaît plus équilibrée. Ce sont deux configurations observées, pas deux causalités économiques démontrées.
Les régimes de croissance diffèrent également : France +75 % pour le marché et +87 % pour Beauty ; Allemagne +74 % et +82 % ; Espagne +71 % et +76 % ; Italie +47 % et +43 % ; Royaume-Uni +25 % et +32 % sur la période comparée. La bonne question devient : quels mécanismes, quelles catégories et quels canaux expliquent ces trajectoires ?
08 — Insight #3 : le classement ne suffit pas
Dans le panel Top 200 Beauty France, le Top 10 concentre environ 41,7 % du CA observé et le Top 50 environ 75,7 %. Les 94 boutiques de marques représentent 68,2 % du CA du panel, contre 31,8 % pour les 106 revendeurs. Les 130 boutiques domestiques pèsent 85,6 %, contre 14,4 % pour les 70 cross-border.
La présence dans un classement n’est donc pas équivalente au poids économique. Pour une direction e-commerce ou marketplace, cette information peut orienter le choix du peer group, la lecture du risque de concentration ou la stratégie d’entrée. Pour une étude de marché, elle rappelle qu’un Top N doit toujours être accompagné de son dénominateur et de son périmètre.
09 — Insight #4 : les créateurs forment un graphe
Le panel compte 1 950 relations créateur × shop. Les créateurs rattachés au vendeur représentent 104 relations — 5,3 % — mais 25,3 % du GMV créateur observé. Le GMV médian par relation est de 4 380 € pour les relations rattachées contre 630 € pour les indépendantes ; l’audience médiane est pourtant plus faible côté rattaché, 10 150 contre 27 500.
Cette observation est contre-intuitive et utile parce qu’elle déplace la question. Il ne s’agit plus de chercher le plus gros compte, mais de comprendre la nature de la relation, le rôle du créateur dans le dispositif et la concentration de la performance. Elle reste une observation du panel, jamais une loi universelle ni une preuve de causalité.
10 — Insight #5 : un KPI peut raconter une histoire incomplète
Le boost vidéo illustre la différence entre volume et efficacité. Le GMV médian d’une vidéo boostée est d’environ 911,7 €, contre 215,6 € pour une vidéo organique — environ ×4,2. Mais rapporté à 1 000 vues, le GMV est de 9,5 € contre 12,9 €, soit environ −26 % pour la vidéo boostée. Le boost achète fortement de la portée et du volume ; il ne garantit pas une meilleure efficacité à audience comparable.
Le coût média n’étant pas inclus, aucune conclusion de rentabilité complète ne doit être tirée. La valeur analytique tient précisément dans cette deuxième lecture : ajouter le bon dénominateur pour éviter de confondre amplification et rendement.
11 — Insight #6 : prix et activation sont des leviers
Sur Beauty France, la zone 10—30 € représente environ 58 % du GMV et 63 % des ventes observées. Les tranches 10—15 € portent le volume ; la zone 25—30 € contribue davantage à la valeur. Au-delà de 50 €, on observe environ 13 % du GMV pour 3 % des volumes. Cette lecture prix peut servir à une discussion assortiment, positionnement ou panier — à condition de conserver les dénominateurs du panel.
Les hashtags et le calendrier montrent une autre piste : le GMV moyen par vidéo observé est d’environ 4 347 € pour #lesoffresdéferlent et 3 387 € pour #offresdété, contre 1 678 € pour #skincare, 738 € pour #makeup et 551 € pour #parfum. Cela signale un possible effet des opérations commerciales de plateforme ; cela ne prouve pas que le hashtag, à lui seul, cause la performance.
12 — Construire une histoire plutôt qu’une collection de charts
Le storytelling automatisé est central, mais il ne consiste pas à demander au système de choisir vingt graphiques. Il s’agit de faire progresser le lecteur : quelle est la taille du terrain, comment les marchés se structurent-ils, à quel rythme évoluent-ils, quels acteurs captent la valeur, quels leviers méritent d’être testés ?
Le résultat peut être rendu en page web, PDF, deck, email ou API depuis un document intermédiaire structuré. Les graphiques deviennent des composants validés ; les formats deviennent des renderers d’une même analyse. La sophistication vient de la cohérence du chemin, pas du nombre d’objets affichés.
13 — Ne pas faire dire aux données ce qu’elles ne disent pas
La qualité analytique ne se résume pas à multiplier les KPI. Elle repose sur huit disciplines : provenance explicite, vocabulaire d’estimation, panels identifiés, prudence sur les petits volumes, focus sur les Top N quand le bruit l’exige, comparaisons longitudinales, cross-check entre les couches et validation humaine.
Chaque insight doit être classé : FACT, DERIVED_METRIC, OBSERVATION, INTERPRETATION ou HYPOTHESIS. Une interprétation peut être précieuse sans devenir un fait. Une hypothèse peut guider l’action sans être présentée comme une causalité.
Le cas medicube sert de confrontation terrain avec l’agence travaillant sur sa stratégie France. Le rôle de cette confrontation est de tester la cohérence et la pertinence de la lecture ; le cas ne lui attribue aucune validation précise qui ne serait pas documentée.
14 — Ce que nous avons réellement construit
La contribution ne tient pas à un prompt. Elle comprend la conception du workflow, l’acquisition, le nettoyage, la normalisation, le modèle, l’historisation, les KPI, la segmentation, la logique algorithmique, le balayage des données, les règles de gestion, les seuils, les croisements, les graphiques, l’architecture de restitution et l’industrialisation de la génération.
Le benchmark métier et l’analyse sont conduits et challengés avec Qider et Adrien. Les seuils et croisements métier sont construits par itérations, notamment avec Qider. Le cas est donc une combinaison : engineering data + analytics + expertise métier + storytelling. Ce mélange compte davantage que l’étiquette « IA ».
15 — Pourquoi cela dépasse TikTok Shop
Une fois séparés le socle et la verticale, le pattern devient portable. Les connecteurs, le modèle d’exécution, les contrôles, le document intermédiaire, les renderers et le registre de provenance peuvent servir ailleurs. Ce qui reste spécifique est la sémantique : les entités, les métriques, les seuils, les segments, les événements et les critères d’acceptation.
La même architecture peut produire un benchmark concurrentiel, une étude de prix, une analyse de canaux, une étude d’opportunité, une analyse de portefeuille, un business plan, une étude de market entry ou une étude stratégique. On change le marché, les sources et les questions ; on garde la machine et les conventions de preuve.
INTELLIGENCEPRICING
STUDYPORTFOLIO
ANALYSISMARKET
ENTRYBUSINESS
PLANSTRATEGY
STUDY
16 — La première mise en œuvre reste volontairement cadrée
Scrolls V1 n’est pas présenté comme un SaaS multi-tenant complet, une ingestion temps réel ou une couverture exhaustive de chaque vue. Le produit actuel est un système isolé, déployable et testable, alimenté par des snapshots hors Git. La suite doit renforcer la recette UX/data, le pipeline reproductible, les exports, les états vides, les tests de rendu et le rollback.
- 1Choisir une question métier et une verticale.
- 2Versionner les sources, métriques, seuils et golden set.
- 3Construire la chaîne market → entities → signals.
- 4Produire une restitution avec preuves et limites.
- 5Mesurer le temps gagné et la décision déclenchée.
Le KPI principal de la toolbox n’est donc ni le nombre de lignes de code, ni la beauté du PDF. C’est le temps nécessaire pour passer d’une nouvelle question de verticale à un premier livrable fiable. Chaque nouvelle période doit enrichir l’historique ; chaque nouvelle analyse doit enrichir le modèle ; chaque nouvelle question doit pouvoir devenir une règle ou un indicateur.
Le benchmark est le premier résultat visible. La machine qui l’a produit est la vraie démonstration.
Vous avez une question de marché. Nous préférons construire le système qui permettra d’y répondre aujourd’hui — et aux suivantes demain.