Statisticien et data scientist, deux métiers à ne pas confondre

juil. 07, 2020

L a synonymie n’existe pas, et c’est peut-être bien là l’information fondamentale de cet article. Nous nous construisons avec l’idée que deux mots distincts peuvent avoir le même sens. Nous sommes régulièrement encouragés à éviter les répétitions par tous les moyens, quitte à utiliser un mot qui n’exprime pas tout à fait notre pensée. Nombreux sont pourtant les universitaires à répéter inlassablement que la langue française est riche et complexe, et qu’il serait absurde de créer deux mots différents ayant exactement le même sens.


Cet article a pour objectif d’expliquer pourquoi les métiers de data scientist et de statisticien ne peuvent pas être confondus ou considérés comme identiques. On parle donc de comparer un mot de la langue française et… un anglicisme. Le problème avec cette dernière catégorie, c’est qu’on se croit vite tout permis. Quand on sait en plus qu’il s’agit d’un anglicisme dont le sens est en constante évolution, on a envie de jeter le stylo (ou le clavier) et d’abandonner face à la difficulté de la tâche. Il est pourtant primordial de comprendre pourquoi le terme de data scientist a émergé et en quoi ce métier diffère des autres métiers existants, en particulier celui de statisticien.


Nous ne chercherons pas ici à comparer le champ des statistiques avec celui de la data science. Cette précision est importante car la data science n’est pas composée exclusivement de data scientists. On y trouve pêle-mêle des data engineers, des machine learning engineers, des data analysts, des products owners et même des statisticiens. C’est à s’y perdre n’est-ce pas ? On ne cherche pas non plus à comparer des outils de machine learning avec des outils statistiques. Non, il s’agit bien de traiter des différences entre deux métiers.


La première des différences est évidente : l’un de ces métiers est beaucoup plus ancien que l’autre. Les premiers statisticiens  (1)  sont apparus durant le XVIIIème siècle (Thomas Bayes pour n’en citer qu’un), avec une réelle émergence de la discipline le siècle suivant. Les termes de data science et data scientist ne sont utilisés que beaucoup plus tardivement à la fin du XXème siècle, en 1987  (2) .

Une autre différence majeure est que les compétences de recherche sont indispensables pour exercer le métier de data scientist. La première raison à cela est la diversité et la constante augmentation du nombre d’outils. Un data scientist doit être en perpétuelle montée en compétences tout en maintenant une routine de veille sur toutes les innovations du domaine. Cela est en tout point comparable à la capacité d’un chercheur à effectuer l’état de l’art de son champ de recherche à tout moment. La seconde raison justifiant la nécessité de ces compétences est la structuration même des missions des data scientists. Ces dernières peuvent démarrer à un stade où le bénéficiaire n’a pas encore défini précisément son besoin ou que sa formulation n’est pas en adéquation avec les outils disponibles.


Dire : “J’ai besoin de simuler l’ensemble de la société humaine à la maille de l’être humain” n’est pas un besoin en adéquation avec les possibilités de notre époque. C’est au data scientist d’accompagner ce dernier pour identifier les progressions possibles à l’aide des différentes sources de données voire parfois d’identifier de nouvelles sources de données que l’interlocuteur n’avait pas identifiées. Tout ce travail préliminaire est par nature absent du métier de statisticien dont le travail est d’appliquer des outils de statistiques à un problème cadré et bien défini.


Les outils du statisticien – le logiciel R étant l’un des plus connus – n’en restent pas moins inclus dans ceux du data scientist, qui doit par conséquent avoir des compétences en statistiques. La question qui vient immédiatement est celle de la nature des autres outils du data scientist. Ces derniers n’émergent pas directement du champ des statistiques mais de la théorie de l’apprentissage statistique. Vous l’aurez compris, ce sont ceux que nous regroupons habituellement dans le champ du machine learning. À la différence des outils du statisticien, les outils de machine learning ont pour objectif d’entraîner un algorithme pour prédire de futurs résult ats (3), sans nécessairement que les étapes de calcul soient interprétables. Cette approche ayant été développée conjointement avec l’augmentation de la puissance de calcul informatique, aucun de ces outils ne peut être utilisé autrement qu’avec un ordinateur. 



Une dernière grande différence entre le métier de data scientist et celui de statisticien est leur caractère pluridisciplinaire, beaucoup plus développé dans le premier cas que dans le second. Il est en effet requis pour un data scientist d’avoir une bonne connaissance d’un ou plusieurs champs disciplinaires scientifiques (physique, chimie, biologie…). Il est même de plus en plus fréquent d’étendre cette recherche de pluridisciplinarité au-delà des sciences dites “dures”, notamment du fait de l’émergence des systèmes complexes ou encore de l’éconophysique, pour n’en citer que deux. C’est d’ailleurs cette différence qui motive les entreprises à recruter des data scientists dans des domaines plus variés que le simple domaine des mathématiques ou de l’informatique.


Nous avons par cet article voulu évoquer brièvement les différences les plus importantes entre les deux métiers. Cela ne nous a pas empêché pour autant de faire ressortir les points communs qui les relient et de mettre en valeur le fait que le métier de data scientist ne pourrait exister sans l’émergence quelques siècles plus tôt du domaine des statistiques ou plus récemment de la forte augmentation de la puissance de calcul.


Gardons également à l’esprit que la Data Science tout entière est en perpétuelle évolution et qu’aucun consensus général n’existe sur sa définition. La réponse sera en effet différente que vous vous placiez dans un grand groupe ou une petite start up ou bien encore que vous vous attachiez plus à la sémantique qu’aux considérations des diverses personnes autour de vous.




(1) : Bien que l’on pourrait dater la première apparition des statistiques à l’époque des mathématiques précolombiennes, nous n’évoquerons ici que les mathématiques modernes (qui correspond au réel avènement du champ des statistiques mathématiques).

(2) :  Data Science and Its Applications, préface, Academic Press, 1995.pdf  

(3) : Il s’agit ici d’un constat global. Il existe en effet des algorithmes à la frontière entre statistique et machine learning, comme les algorithmes de clustering.

Ressources Agaetis

par David Walter 16 févr., 2024
OpenAI, a récemment dévoilé SORA, un outil de génération de vidéo. SORA monte encore une marche, offrant des capacités de génération de vidéos réalistes. Cet article explore les caractéristiques clés de SORA, son impact potentiel sur diverses industries, les points de réflexions et l'impact pour l'avenir de la création de contenu. Qu'est-ce que SORA ? SORA est une interface avancée conçue par OpenAI qui permet de générer des séquences vidéo à partir de descriptions textuelles simples. Utilisant des techniques de pointe en matière d'intelligence artificielle et d'apprentissage profond, SORA est capable de comprendre des commandes complexes et de les traduire en contenus visuels impressionnants. Une qualité de génération inégalée La capacité de SORA à générer des vidéos époustouflantes souligne un tournant dans le domaine de la production vidéo, où la qualité et la créativité ne sont plus entravées par des contraintes techniques ou financières. Cette avancée s'inscrit dans un contexte plus large où l'IA transforme profondément les industries créatives, offrant des outils puissants pour la transcription, le doublage, la création d'avatars générés par IA, et même la suppression de fonds vidéo, rendant ces processus plus accessibles et flexibles​​​​​​. Des outils comme Descript et Adobe Premiere Pro intègrent des fonctionnalités AI pour améliorer le processus d'édition vidéo, depuis la rotation des yeux jusqu'à la génération de transcriptions et sous-titres​​. De même, la comparaison entre DALL-E 3 et Midjourney montre comment l'IA peut capturer des détails et des ambiances spécifiques dans les images, un principe également applicable à la vidéo​​. La révolution du streaming vidéo illustre comment l'adaptation numérique bouleverse les modèles économiques traditionnels, offrant une perspective sur la manière dont les technologies génératives pourraient remodeler le paysage médiatique​​. L'impact de ces technologies dépasse la simple création de contenu ; elles remodèlent également notre compréhension de la créativité et ouvrent de nouvelles voies pour l'expression artistique et la communication. Avec des outils comme SORA, la barrière entre l'idée et sa réalisation se réduit, permettant à un plus grand nombre de personnes de donner vie à leurs visions créatives sans les contraintes traditionnelles de la production vidéo. Cet élan vers une qualité de génération inégalée par l'IA soulève des questions importantes sur l'avenir du contenu créatif et la manière dont nous valorisons l'interaction entre l'humain et la technologie dans le processus créatif. Alors que nous explorons ces nouvelles frontières, il est crucial de rester attentifs aux implications éthiques et aux défis que ces technologies posent, tout en reconnaissant leur potentiel pour enrichir notre monde visuel et narratif.
Airflow PostgreSQL MongoDB
par Ikram Zouaoui 07 févr., 2024
Integration de technologies pour optimiser les flux de travail : L'article met en lumière une approche combinée utilisant Airflow, PostgreSQL, et MongoDB pour améliorer l'efficacité des flux de travail liés aux données.
Show More
Share by: