Les industries du fitness et de la compétition en natation sont-elles prêtes pour l'IA en matière de données ? – Partie 1

Publié le 11 février 2025
Modifié le 7 juillet 2026
Introduction
Les analyses basées sur les données ont transformé de nombreux sports, en soutenant des plans d'entraînement plus précis, la surveillance des risques de blessures et un retour d'information en temps réel sur les performances (Vec et al., 2024 ; Leckey et al., 2025). Pourtant, dans le domaine de la natation — un sport où les millisecondes comptent — la qualité et la structure des données demeurent des défis majeurs. Comment l'IA et le ML peuvent-ils nous aider à prendre de meilleures décisions, et quels risques surviennent lorsque la qualité des données est négligée ?
Ce premier volet de notre série en deux parties propose une revue de la littérature sur la préparation des données pour l'IA dans le sport. Il s'appuie sur des travaux de recherche en IA/ML et applique ces idées à des scénarios propres à la natation. Notre objectif est de combler le fossé entre ce dont les systèmes d'IA ont besoin et ce que la natation peut offrir. Nous explorerons les fondements de la qualité des données, les dangers d'une mauvaise gestion des données et les piliers essentiels pour construire des jeux de données robustes et prêts pour l'IA. À la fin de cette revue, vous comprendrez pourquoi des données bien structurées et de haute qualité sont indispensables pour des analyses avancées, une meilleure prise de décision et un retour d'information plus utile sur les performances en piscine.
Sections abordées dans la Partie 1 :
- Section 1 : Pourquoi la qualité des données est essentielle pour le ML/IA Nous présentons les principales raisons pour lesquelles des données de haute qualité et bien gérées sont indispensables aux applications d'IA et de ML, en particulier dans les sports de performance comme la natation.
- Section 2 : Les obstacles, pièges et défis des données de mauvaise qualité Cette section met en évidence les conséquences pratiques de mauvaises pratiques en matière de données, notamment les modèles biaisés, les stratégies d'entraînement erronées et le gaspillage de ressources.
- Section 3 : Les fondements essentiels pour garantir des données de haute qualité en IA/ML Nous présentons les piliers clés d'une gestion fiable des données, de la qualité intrinsèque et contextuelle à la conformité éthique, tous indispensables pour produire des résultats d'IA dignes de confiance.
Section 1 : Pourquoi la qualité des données est essentielle pour le ML/IA — « Le moteur de l'IA »
Imaginez un moteur fonctionnant avec un carburant de mauvaise qualité ou contaminé. Il ne peut pas fonctionner de manière optimale. Les données fonctionnent de la même manière pour le Machine Learning (ML) et l'Intelligence Artificielle (IA). Dans le sport, en particulier en natation, des données précises alimentent les analyses modernes, le suivi des performances et la prise de décision. Des données de mauvaise qualité ou incomplètes peuvent induire en erreur même les systèmes d'IA les plus avancés, en distordant potentiellement les plans d'entraînement et les décisions en compétition.
Voici les principales raisons pour lesquelles la qualité des données est vitale pour toute application pilotée par l'IA :
- Précision et fiabilité des modèles Des données de haute qualité aident les modèles d'IA à produire des résultats plus fiables. En natation, des données cohérentes et précises sur des métriques telles que les comptages de cycles, les temps par longueur et la variabilité de la fréquence cardiaque peuvent aider les entraîneurs et les athlètes à interpréter les analyses générées par l'IA avec plus de confiance. À l'inverse, des données de mauvaise qualité peuvent conduire à des modèles peu fiables et à des recommandations d'entraînement erronées (Priestley et al., 2023 ; Polyzotis et al., 2018).
- Évitement des cascades de données Les erreurs dans les données peuvent se propager tout au long du pipeline ML, créant un effet de cascade où de petites erreurs initiales s'amplifient en problèmes plus importants. Par exemple, un enregistrement systématiquement incorrect des temps par longueur peut fausser l'analyse des allures, les prédictions de fatigue et les stratégies de course, entraînant des inefficacités coûteuses (Sambasivan et al., 2021 ; Polyzotis et al., 2018).
- Biais et équité Des données biaisées ou incomplètes, en particulier dans les sports de compétition, peuvent conduire à des analyses faussées et à des résultats inéquitables. Par exemple, des données d'entraînement limitées à certains profils de nageurs ou à certaines conditions peuvent exclure des facteurs clés, créant des modèles qui favorisent certains athlètes par rapport à d'autres. Garantir des données diversifiées et représentatives contribue à réduire les biais et à améliorer la généralisation (Zhou et al., 2024 ; Qayyum et al., 2020).
- Nettoyage et préparation des données Un nettoyage efficace des données supprime le bruit, corrige les incohérences et traite les valeurs manquantes. C'est comme maintenir la qualité de l'eau d'une piscine — sans un nettoyage approprié, les données de performance des nageurs et les analyses de l'IA peuvent en pâtir. Le nettoyage pour le ML doit également tenir compte de l'application visée, et pas seulement de la suppression générique des erreurs (Neutatz et al., 2021 ; Polyzotis et al., 2018 ; Priestley et al., 2023).
- Exigences spécifiques au domaine Chaque sport présente des métriques et des exigences uniques. En natation, la surveillance de métriques telles que la fréquence de nage, les intervalles de repos et les phases sous-marines est essentielle. Adapter les contrôles de qualité des données à ces spécificités aide les résultats de l'IA à répondre aux besoins réels de performance plutôt qu'à la simple disponibilité générique des données (Priestley et al., 2023 ; Rangineni, 2023).
- Surveillance et gestion continues La collecte de données ne s'arrête pas une fois qu'un modèle est entraîné. Les performances des nageurs évoluent, de nouveaux athlètes intègrent les programmes et les capteurs peuvent changer au fil du temps. La surveillance continue des données entrantes aide les outils d'IA à rester pertinents dans le contexte où ils sont utilisés (Bangad et al., 2024 ; Zhou et al., 2024).
- Gestion globale de la qualité des données La gestion de grands volumes et de diverses variétés de données d'entraînement — telles que les comptages de longueurs, les mesures biométriques et les analyses vidéo — nécessite des processus robustes et évolutifs. Une stratégie claire en matière de qualité des données aborde le volume, la variété et la vélocité afin de maintenir la cohérence tout au long du cycle de vie du ML (Rangineni, 2023 ; Priestley et al., 2023).
- Considérations éthiques et juridiques La collecte de métriques de performance et de santé soulève des préoccupations éthiques, notamment en matière de confidentialité et de conformité. Des normes élevées de qualité des données, une gestion sécurisée et le respect des lignes directrices éthiques aident les organisations à remplir leurs obligations légales (Qayyum et al., 2020 ; Zhou et al., 2024).
La qualité des données constitue le fondement des systèmes ML/IA réussis. Des données précises, complètes et bien gérées peuvent alimenter des modèles plus fiables, favorisant la confiance des entraîneurs, des athlètes et des parties prenantes. Traiter les données comme le « carburant » des applications d'IA soutient des résultats plus équitables, que ce soit dans les centres d'entraînement, les laboratoires de recherche ou les compétitions mondiales.
Section 2 : Les obstacles, pièges et défis des données de mauvaise qualité
Dans l'analyse du sport, une mauvaise qualité des données n'est pas un simple contretemps mineur — elle peut faire dérailler des programmes d'entraînement, gaspiller de précieuses ressources et éroder la confiance dans les analyses pilotées par l'IA. Des entraîneurs qui suivent les temps de virage aux scientifiques du sport qui analysent de grands jeux de données de capteurs, la compréhension de ces pièges essentiels est cruciale pour garantir des résultats fiables.
- Dégradation des performances du modèle Les modèles d'IA s'appuient sur des données précises et complètes pour apprendre et effectuer des prédictions. Lorsqu'ils reçoivent des données manquantes ou incorrectes — telles que des temps par longueur inexacts ou des comptages de cycles mal enregistrés — les modèles peuvent produire des prédictions peu fiables. Cela peut se traduire par des stratégies d'allure sous-optimales ou des décisions d'entraînement potentiellement inappropriées si les résultats sont traités comme des prescriptions plutôt que comme une aide à la décision révisée par l'entraîneur (Priestley et al., 2023 ; Leckey et al., 2025).
- Cascades de données De petites erreurs de données en début de pipeline peuvent se transformer en problèmes plus importants en aval. Par exemple, un moniteur de fréquence cardiaque qui enregistre incorrectement des pics fréquents pourrait déclencher de « fausses alarmes » concernant la santé d'un athlète, entraînant des modifications inutiles des plans d'entraînement. Ces cascades réduisent la confiance dans les systèmes d'IA et peuvent compromettre la qualité des décisions (Sambasivan et al., 2021 ; Polyzotis et al., 2018).
- Problèmes de biais et d'équité Une mauvaise qualité des données provient souvent de jeux de données incomplets qui ne représentent pas la diversité des populations d'athlètes. Lorsque les modèles sont entraînés sur des données limitées — telles que des métriques provenant uniquement de nageurs d'élite — ils peuvent produire des conseils non pertinents ou potentiellement inappropriés pour les jeunes athlètes ou les athlètes masters. Une collecte de données inclusive et représentative est essentielle pour atténuer les biais (Zhou et al., 2024 ; Qayyum et al., 2020).
- Absence de métriques standardisées Sans méthodes standardisées pour enregistrer les métriques clés (par exemple, la fréquence de nage ou les temps de segments par longueur), il devient difficile de comparer les données entre équipes ou études. Des définitions incohérentes peuvent créer de la confusion lors de l'adoption de solutions d'IA, ralentissant les progrès et amplifiant les erreurs dans les applications (Priestley et al., 2023).
- Empoisonnement des données et risques de sécurité Lorsque les données sont mal gérées, elles deviennent vulnérables aux manipulations ou aux attaques malveillantes. Dans le sport, des données de performance altérées pourraient induire en erreur les recruteurs, fausser les classements, ou même affecter les marchés de paris sportifs. La mise en place de mesures robustes de validation et de sécurité aide à prévenir ces risques d'empoisonnement des données (Qayyum et al., 2020).
- Contraintes de ressources et problèmes de documentation Les équipes sous-dotées en ressources et les protocoles de collecte de données peu clairs conduisent souvent à des erreurs évitables. Par exemple, des procédures de calibration des capteurs mal documentées peuvent entraîner un étiquetage incorrect des données, qui nécessite ensuite un effort considérable pour être corrigé. Au fil du temps, ces lacunes en matière de ressources cumulent les inefficacités (Sambasivan et al., 2021).
- Défis éthiques et juridiques La gestion des données sensibles des athlètes — y compris les métriques biométriques ou liées à la santé — exige une conformité stricte avec les réglementations en matière de confidentialité. Une gestion négligente des données pourrait entraîner une non-conformité, des problèmes juridiques et une détérioration de la confiance entre les athlètes et le personnel (Qayyum et al., 2020 ; Zhou et al., 2024).
- Inefficacités opérationnelles Une mauvaise qualité des données peut considérablement ralentir les progrès en nécessitant un nettoyage et une validation constants. Le temps consacré à « combattre » les mauvaises données pourrait être mieux utilisé pour développer des stratégies d'entraînement avancées ou mener des expériences supplémentaires (Priestley et al., 2023).
- Lacunes en matière de formation et d'éducation De nombreuses organisations sportives manquent de formation adéquate en collecte de données, gestion et éthique. Sans ces connaissances fondamentales, les équipes peuvent involontairement introduire des erreurs dans les jeux de données, créant ainsi de nouveaux défis pour le déploiement à grande échelle des solutions d'IA (Zhou et al., 2024).
- Généralisation et représentativité Les modèles entraînés sur des jeux de données étroits peinent souvent à se généraliser à différents contextes. Par exemple, un modèle entraîné exclusivement sur des nageurs d'élite peut offrir peu de valeur pour les jeunes athlètes ou les masters, nécessitant une collecte de données supplémentaire et un réentraînement (Priestley et al., 2023 ; Rangineni, 2023).
Une mauvaise qualité des données présente des défis importants pour l'adoption de l'IA dans le sport. De la dégradation des performances des modèles aux risques éthiques, en passant par les retards opérationnels, ces pièges soulignent la nécessité de pipelines de données robustes, bien documentés et sécurisés. En relevant ces défis, les organisations peuvent donner aux entraîneurs, aux scientifiques et au personnel de soutien une meilleure base pour faire confiance aux analyses de l'IA — soutenant ainsi de meilleures décisions d'entraînement et des résultats plus équitables.
Section 3 : Les fondements essentiels pour garantir des données de haute qualité en IA/ML
Atteindre une haute qualité des données ne s'improvise pas — cela requiert des stratégies intentionnelles et des processus méticuleux. Dans le sport, en particulier en natation, les données proviennent d'une variété de sources telles que les temps par longueur, les comptages de cycles et les métriques physiologiques. Pour aider les modèles d'IA à produire des analyses fiables, chaque point de donnée doit être précis, pertinent et contextuellement significatif. Voici les piliers clés soutenant une collecte, une gestion et une utilisation efficaces des données.
-
Qualité intrinsèque des données La qualité intrinsèque vise à garantir que les données elles-mêmes sont précises, cohérentes et complètes. En natation, même une petite inexactitude — telle qu'un temps par longueur mal enregistré — peut fausser les recommandations d'entraînement et affecter les résultats des athlètes. Pour atteindre une haute qualité intrinsèque, les capteurs tels que les plaquettes de chronométrage et les dispositifs portables doivent faire l'objet d'étalonnages réguliers. Des vérifications ponctuelles périodiques, telles que la comparaison des données automatisées avec des analyses vidéo, contribuent à valider la précision des métriques clés. Les systèmes automatisés qui signalent les valeurs aberrantes, comme les fréquences de nage dépassant les limites physiques, sont également importants (Priestley et al., 2023 ; Rangineni, 2023). Ces mesures combinées contribuent à maintenir des données suffisamment fiables pour une analyse assistée par l'IA.
-
Qualité contextuelle La qualité contextuelle garantit que les données sont pertinentes, actuelles et adaptées à la tâche d'IA visée. Par exemple, les données d'entraînement recueillies dans des piscines en petit bain peuvent ne pas être applicables à la natation en eau libre, rendant la segmentation essentielle. Pour maintenir la pertinence contextuelle, les équipes doivent définir clairement les objectifs de collecte de données, tels que l'amélioration des départs, des virages ou de l'endurance générale. Les données doivent être classifiées en fonction des conditions telles que la taille de la piscine ou l'altitude pour fournir des analyses contextuellement significatives. De plus, à mesure que les besoins d'entraînement évoluent, les processus de collecte de données doivent également évoluer pour rester alignés sur les objectifs actuels (Priestley et al., 2023 ; Zhou et al., 2024).
-
Qualité représentationnelle La qualité représentationnelle vise à assurer des formats de données cohérents et interprétables entre les équipes et les systèmes. Sans standardisation, les données de performance peuvent être mal interprétées — par exemple, lorsque différentes équipes désignent une longueur de 50 mètres par « 50 Libre » ou « NL_50 ». L'adoption de conventions de nommage standardisées et la maintenance d'un schéma de données partagé entre les équipes contribuent à atténuer ces problèmes. Les équipes devraient également utiliser des métadonnées pour documenter les détails sur le moment et la manière dont les données ont été collectées (Priestley et al., 2023). Ces mesures préviennent la confusion et améliorent la collaboration entre les parties prenantes internes et externes.
-
Accessibilité L'accessibilité garantit que les données sont disponibles pour les utilisateurs autorisés tout en protégeant la confidentialité. Les entraîneurs, les scientifiques du sport et les athlètes ont souvent besoin d'un accès en temps réel aux données de performance pour ajuster l'entraînement. Des systèmes cloud sécurisés avec contrôle d'accès basé sur les rôles peuvent fournir cet accès sans compromettre la sécurité. De plus, des tableaux de bord conviviaux conçus pour les utilisateurs non techniques permettent une accessibilité plus large. Pour les données sensibles des athlètes, le chiffrement doit être appliqué pour répondre aux réglementations en matière de confidentialité (Zhou et al., 2024 ; Qayyum et al., 2020). Ces mesures contribuent à équilibrer la disponibilité des données et la confidentialité tout en soutenant une prise de décision efficace.
-
Gestion du cycle de vie des données La gestion du cycle de vie des données supervise les données de la collecte au traitement, au stockage, à l'analyse et à l'archivage ou la suppression finale. La traçabilité est essentielle — sans elle, des erreurs peuvent être introduites dans le pipeline d'IA sans être détectées. La maintenance d'une documentation approfondie, incluant des détails tels que les dates de collecte et les journaux de calibration des capteurs, contribue à préserver l'intégrité des données. Des révisions périodiques sont essentielles pour supprimer les données obsolètes ou non pertinentes tout en maintenant l'accent sur les jeux de données de qualité (Rangineni, 2023 ; Priestley et al., 2023). Les stratégies de sauvegarde et de reprise après sinistre soutiennent en outre la fiabilité des données à long terme.
-
Conformité éthique et juridique La conformité éthique et juridique est cruciale lors du traitement de données sensibles, en particulier dans le sport où des données biométriques et de santé sont impliquées. Les athlètes ont confiance que leurs informations personnelles seront protégées et utilisées de manière responsable. Pour maintenir cette confiance, les équipes doivent anonymiser les données des athlètes dans la mesure du possible et veiller à ce que l'utilisation des données soit conforme aux lois sur la confidentialité et aux exigences de gouvernance applicables. Obtenir le consentement éclairé des athlètes avant de collecter et d'utiliser leurs données est également essentiel (Qayyum et al., 2020 ; Zhou et al., 2024). Le non-respect de ces directives expose à des répercussions juridiques et à des atteintes à la réputation.
-
Surveillance et amélioration continues La surveillance continue contribue à maintenir la qualité des données au fil du temps, à mesure que les données de performance évoluent. Les programmes de natation introduisent souvent de nouvelles métriques et technologies, rendant la validation continue importante. Des scripts de validation automatisés peuvent détecter les anomalies, telles que des temps par longueur inhabituellement courts ou longs, avant qu'elles n'affectent les analyses. Des audits périodiques contribuent à maintenir l'exhaustivité et l'intégrité, tandis que des boucles de rétroaction impliquant les entraîneurs et les athlètes permettent une résolution rapide des divergences (Bangad et al., 2024 ; Zhou et al., 2024). Cette approche proactive contribue à maintenir un pipeline de données dynamique et fiable.
-
Intégration des connaissances du domaine L'intégration des connaissances du domaine tire parti de l'expertise des entraîneurs, des scientifiques du sport et des athlètes pour interpréter et valider les données efficacement. Les anomalies, telles qu'une augmentation soudaine de la fréquence cardiaque, peuvent avoir des explications simples comme des dysfonctionnements de capteurs ou des conditions environnementales. Les experts du domaine peuvent distinguer les vrais problèmes des erreurs d'équipement, évitant ainsi des ajustements inutiles du modèle. La collaboration avec les entraîneurs sur les protocoles de collecte de données et la validation des recommandations pilotées par l'IA par rapport à l'expérience du terrain améliorent les chances que les analyses soient utiles en pratique (Rangineni, 2023 ; Neutatz et al., 2021). Ce processus itératif contribue à maintenir les décisions basées sur les données en adéquation avec l'expérience pratique.
En se concentrant sur ces fondements essentiels — qualité intrinsèque et contextuelle, cohérence représentationnelle, accessibilité, gestion du cycle de vie, conformité, surveillance continue et expertise du domaine — les organisations peuvent établir des pipelines de données plus dignes de confiance. Pour les professionnels de la natation, cela soutient des décisions d'entraînement mieux informées, un retour d'information plus précis aux athlètes, une confiance accrue et des flux de travail de soutien à la performance plus utiles.
Résumé
Dans cette première partie, nous avons exploré les principes fondamentaux de la qualité des données et montré comment des données de mauvaise qualité peuvent faire dérailler même les projets d'IA les plus avancés. Des enregistrements négligés ou incomplets ne font pas que ralentir l'innovation. Ils peuvent activement induire en erreur les entraîneurs, les athlètes et les analystes. Mais comment ces concepts s'appliquent-ils au paysage actuel des données en natation ?
Dans le prochain volet, nous examinerons les réalités pratiques de la gestion des données des séances d'entraînement en natation. Nous mettrons en évidence les domaines dans lesquels l'industrie est forte et ceux où des améliorations sont nécessaires. Nous discuterons également de l'opportunité qu'offre un cadre unifié conçu pour améliorer la gestion des données à tous les niveaux du sport. Enfin, nous répondrons à la question clé : L'industrie de la natation fitness et compétitive dispose-t-elle de données adaptées à l'IA ? Restez connectés pour un examen approfondi de la façon dont nous pouvons utiliser l'IA pour soutenir de meilleures décisions pour les nageurs à tous les niveaux.
Remarque : Cet article a été rédigé à l'origine en anglais et traduit dans d'autres langues à l'aide d'outils d'IA automatisés afin de partager ces informations avec un plus grand nombre de personnes. Nous faisons de notre mieux pour que les traductions soient précises et faciles à comprendre, et nous accueillons volontiers l'aide de la communauté pour les améliorer. Si un élément d'une version traduite est peu clair, incorrect ou diffère de la version anglaise, le texte original en anglais doit être considéré comme la version officielle.
Sources
Bangad, N., Jayaram, V., Sughaturu Krishnappa, M., Banarse, A., Bidkar, D., Nagpal, A., & Parlapalli, V. (2024). A theoretical framework for AI-driven data quality monitoring in high-volume data environments. International Journal of Computer Engineering & Technology, 15, 618-636. https://doi.org/10.5281/zenodo.13878755
Leckey, C., van Dyk, N., Doherty, C., Lawlor, A., & Delahunt, E. (2025). Machine learning approaches to injury risk prediction in sport: A scoping review with evidence synthesis. British Journal of Sports Medicine. https://doi.org/10.1136/bjsports-2024-108576
Neutatz, F., Chen, B., Abedjan, Z., & Wu, E. (2021). From cleaning before ML to cleaning for ML. Bulletin of the IEEE Computer Society Technical Committee on Data Engineering.
Polyzotis, N., Roy, S., Whang, S., & Zinkevich, M. (2018). Data lifecycle challenges in production machine learning: A survey. ACM SIGMOD Record, 47, 17-28. https://doi.org/10.1145/3299887.3299891
Priestley, M., O'Donnell, F., & Simperl, E. (2023). A survey of data quality requirements that matter in ML development pipelines. Journal of Data and Information Quality, 15. https://doi.org/10.1145/3592616
Qayyum, A., Qadir, J., Bilal, M., & Al-Fuqaha, A. (2020). Secure and robust machine learning for healthcare: A survey. IEEE Reviews in Biomedical Engineering. https://doi.org/10.1109/RBME.2020.3013489
Rangineni, S. (2023). An analysis of data quality requirements for machine learning development pipelines frameworks. International Journal of Computer Trends and Technology, 71, 16-27. https://doi.org/10.14445/22312803/IJCTT-V71I8P103
Roh, Y., Heo, G., & Whang, S. E. (2019). A survey on data collection for machine learning: A big data - AI integration perspective. IEEE Transactions on Knowledge and Data Engineering. https://doi.org/10.1109/TKDE.2019.2946162
Sambasivan, N., Kapania, S., Highfill, H., Akrong, D., Paritosh, P., & Aroyo, L. (2021). "Everyone wants to do the model work, not the data work": Data cascades in high-stakes AI. Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems, 1-15. https://doi.org/10.1145/3411764.3445518
Vec, V., Tomazic, S., Kos, A., & Umek, A. (2024). Trends in real-time artificial intelligence methods in sports: A systematic review. Journal of Big Data. https://doi.org/10.1186/s40537-024-01026-0
Whang, S. E., Roh, Y., Song, H., & Lee, J.-G. (2023). Data collection and quality challenges in deep learning: A data-centric AI perspective. The VLDB Journal, 32. https://doi.org/10.1007/s00778-022-00775-9
Zhou, Y., Tu, F., Sha, K., Ding, J., & Chen, H. (2024). A survey on data quality dimensions and tools for machine learning. 2024 IEEE International Conference on Artificial Intelligence Testing, 120-131. https://doi.org/10.1109/AITest62860.2024.00023
Restez à jour avec Wise Racer
Abonnez-vous pour recevoir de nouveaux articles et des mises à jour de produits de Wise Racer. Nous vous enverrons un e-mail de confirmation avant que votre abonnement ne soit activé.