Retour au fil

Carte data scientist tirée de 40 000 vraies offres : analytique ou machine learning ?

Data with Baraa passe au crible près de 40 000 offres issues de plus de 10 000 entreprises et montre le rôle scindé en deux : 54 % visent l'analytique, 46 % le machine learning.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 71iQH1NQYL0
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Un dataset de quarante mille offres

Les offres réelles valent mieux que les estimations mensuelles. Le présentateur a construit pendant des mois un pipeline de collecte : le système aspire chaque jour les postes ouverts, les nettoie et les rapporte. Le tableau couvre près de 40 000 annonces réelles issues de plus de 10 000 entreprises dans une centaine de pays, dont plus de 6 000 équipes qui recrutent des data scientists. Le récit avance sur ce socle : la question d'ouverture d'abord, puis les concepts, puis les chiffres.

Le classement de la demande bouscule les clichés. L'ingénierie des données arrive première, la data science deuxième ; suivent l'analyste, le développeur BI, l'architecte de données et l'analytics engineer. Le Handbook BLS (www.bls.gov) fixe le salaire médian à 112 590 dollars, l'emploi à 245 900 en 2024, la croissance à 34 % vers 2034 et environ 23 400 ouvertures annuelles. Le flux 2026 de GetUHired (getuhired.co) confirme en direct : 41 240 offres en 90 jours, 3 108 nouveautés par semaine et 32 % de télétravail. La carte 2026 d'Axial Search (axialsearch.com) complète le tableau avec le détail par État, ville et séniorité.

Trois axes placent chaque rôle : trouver des réponses en analyse, préparer les données en ingénierie, construire des modèles en machine learning et IA. L'analyste reste en analyse ; l'ingénieur données campe en ingénierie tout en s'étendant vers l'ingénierie IA ; l'ingénieur machine learning trône au sommet. Le data scientist s'éparpille partout, de l'analyse aux données jusqu'à la modélisation, ce qui en fait l'étiquette la plus floue du marché.

Le flou coûte cher : au moins 19 % des annonces ne sont pas de vrais postes de data science. Certaines cherchent des analystes, des chercheurs IA, des développeurs BI, des ingénieurs données ou des chefs de produit. Le présentateur raconte quatre amis diplômés de master entrés comme data scientists et finissant en ingénierie de données ; trois sont restés, un est revenu. La leçon pratique : lis la fiche de poste ligne par ligne et demande en entretien ce que tu feras vraiment.

Deux métiers : analytique et machine learning

Les offres nettoyées se scindent en deux : 54 % d'analytique, 46 % de machine learning. La première répond aux questions les plus dures de l'entreprise ; la seconde entraîne des modèles de zéro et les intègre en production. L'exemple du recommandeur résume la seconde voie : construire, déployer en direct, nourrir ce que voient des millions de clients. La feuille de route naît de cette fracture.

La voie analytique commence sa journée par une question : analyse de données, modélisation orientée réponses , plan d'expériences et traduction des besoins. Le modèle d'attrition du mois prochain est le cas classique ; les tests A/B prouvent la causalité ; le langage du métier se traduit en données. La sortie, ce sont tableaux, rapports et recommandations ; la table de décision attend les trois.

La voie machine learning transforme les modèles en produit : construire, mettre en production , analyser en amont et systèmes d'agents. Le modèle ne reste jamais sur un portable ; il sert le trafic vivant. Les modèles de langage et les agents percent dans presque chaque offre, et 40 % exigent un système IA complet comme un chatbot ou un agent. Cette attente fait un clin d'œil à la fiche de l'ingénieur IA.

Diplômes, code et librairies

La ligne des diplômes surprend : 72 % des offres en mentionnent un ; doctorat 32 %, master 25 %, licence 14 %. Mais 2 % seulement exigent un doctorat. La licence suffit pour la moitié des postes, et une tranche de 25 % reste ouverte aux profils sans diplôme. Le BLS demande typiquement une licence, tandis que 40 à 50 % des autres rôles ne mentionnent aucun diplôme.

Le code a un sommet net : Python d'abord, SQL ensuite. Où l'intitulé porte donnée, SQL suit. R pèse 36 % en analytique et 12 % seulement en machine learning. Les listes des offres sont des listes de souhaits , pas des check-lists ; personne ne les remplit toutes, et l'ordre signale la priorité.

Méthodes et librairies divergent selon la voie. L'analytique mène avec les statistiques, puis le machine learning et les tests A/B ; le déploiement stagne à 9 %. Le machine learning cite la méthode à 32 % et le déploiement à 30 % contre 9 % en analytique, avec statistiques, A/B, traitement du langage et deep learning derrière : aucune maîtrise des réseaux de neurones n'est requise. Côté librairies, l'analytique dit PySpark et Pandas avec la donnée massive à l'échelle Databricks. Le machine learning couronne PyTorch avec TensorFlow, puis PySpark, scikit-learn, Pandas et NumPy. Skillenai (skillenai.com) mesure 2 161 offres PySpark en 90 jours, en hausse de 8 %, contre 5 534 offres PyTorch, bond de 38 % avec San Francisco en tête ; PyTorch figure dans 9,3 % des offres data.

Plateformes et feuille de route

Le cloud et la visualisation ferment le cadre. AWS mène, surtout en machine learning, avec Google Cloud second ; Databricks court légèrement devant Snowflake et l'écart se creuse. L'IA générative entre déjà dans le top trois des compétences de la voie machine learning, devant PyTorch ; elle reste au milieu à 16 % en analytique pendant que les agents traînent en bas. Tableau bat Power BI sur la visualisation avancée et la vitesse à grande échelle ; Power BI règne sur le reporting standard. Refonte Learning (refontelearning.com) confirme la fracture avec la demande BI entre industries. L'ordre dicte : socle Python plus SQL, statistiques, maths et théorie de l'apprentissage, tests A/B pour l'analytique, modèles de langage et génératif pour le machine learning, base scikit-learn dans les deux voies, PySpark analytique, PyTorch avec TensorFlow modélisateur, Tableau, base AWS et compte Databricks gratuit. La finale tient en un projet de bout en bout : l'analyste conclut avec un dataset et des questions dures, le modélisateur avec un recommandeur et un récit de déploiement vivant, partagé sur LinkedIn. Le parcours associé de 23 cours et 90 heures de DataCamp (datacamp.com) emballe cet ordre ; le premier chapitre est gratuit. L'université donne la théorie, et cette carte comble les vides.

Visualization: nodesdaily AI
DimensionAnalytique (54 %)Apprentissage (46 %)
ObjetRépondre aux questions difficilesMettre des modèles en production
Sortie typiqueTableaux, rapports, conseilsRecommandeurs et agents
Méthode cléStatistiques et tests A/BApprentissage et déploiement
Librairie cléPySpark et PandasPyTorch et TensorFlow
Charge de déploiementFaible (9 % des offres)Forte (30 % des offres)
Nouvelle compétence IALLM à 16 %, milieu de listeGenAI déjà dans le top 3

Moments clés

  1. Le dataset de 40 000 offres présenté
  2. Classement : l'ingénierie première
  3. Trois axes : réponses, données, modèles
  4. Alerte : 19 % d'intitulés erronés
  5. 54 % analytique, 46 % machine learning
  6. Compétences : Python et SQL au sommet
  7. Feuille de route et projet

Commentaire de l’IA

"Ce que je retiens de cette étude, c'est son honnêteté qui bouscule les idées reçues : elle dissipe la peur du deep learning et documente le règne incontesté de Python et SQL. L'IA générative dans le top trois redessine la feuille de route."

Évaluation de l’IA

L'objection la plus forte vise la source elle-même : près de 40 000 offres décrivent l'offre d'emploi, pas les embauches. Ce que les entreprises écrivent diffère de ce qu'elles font ; l'aveu des 19 % mal intitulés le reconnaît. L'inflation des intitulés et l'absence de grilles salariales invitent à une lecture optimiste.

Il manque les grilles de salaires, la répartition par pays et ville et les années d'expérience. Le Handbook BLS (www.bls.gov), avec sa médiane et sa projection, plus le flux hebdomadaire de 3 108 offres de GetUHired (getuhired.co) comblent une partie du vide. L'accent sur les statistiques et les tests A/B est juste, mais le risque de confondre analytique et product analytics n'est jamais discuté.

L'intérêt du présentateur est affiché : les parcours recommandés appartiennent à DataCamp (datacamp.com) et la vidéo porte un code de réduction. Le trio Python, SQL et scikit-learn reste toutefois confirmé par Skillenai (skillenai.com) et les chiffres BLS. À regarder d'un œil critique et à comparer avec des alternatives gratuites.

Ma conclusion pratique est nette : choisis d'abord ta voie, puis plonge dans Python et SQL. Termine un projet de bout en bout, raconte son histoire en entretien, lis chaque offre ligne par ligne. Si tu étudies, audite ton cursus avec cette carte ; sinon, fais de ton portfolio ton diplôme.

Sources

8 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

science des données · carrière · python · machine learning · emploi

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Carte data scientist tirée de 40 000 vraies offres