# Politique de Traitement des Données & Gouvernance ML ## 1. Cadre Général & Engagement Privacy-by-Design Le projet RYM / Peakload traite des données relatives à la pratique sportive, à la physiologie et au suivi de la performance. Conformément au **RGPD (Règlement Général sur la Protection des Données)** et aux directives d'éthique de la recherche (INRIA / CNIL) : * **Minimisation des données** : Seules les métriques strictement nécessaires à l'analyse de la charge et à la prévention des blessures sont collectées. * **Chiffrement de bout en bout** : Toutes les données personnelles et physiologiques sont chiffrées en transit (TLS 1.3) et au repos (AES-256). * **Isolation des environnements** : Séparation stricte entre les données de production, les jeux de données de test et les environnements de recherche. --- ## 2. Classification des Données Traitées | Catégorie de Donnée | Exemples | Niveau de Sensibilité | Mesures de Protection | | :--- | :--- | :--- | :--- | | **Données Identifiantes** | Email, Nom, Prénom, Identifiant unique | **Élevé** | Stockage chiffré, séparé des données de performance. | | **Données Physiologiques** | VRC, Fréquence Cardiaque, Sommeil, Fatigue (RPE) | **Très Élevé (Données de Santé)** | Pseudonymisation à la source, accès restreint aux micro-services ML. | | **Données d'Activité** | Charge d'entraînement, Durée, Type de sport | **Moyen** | Agrégation et horodatage chiffré. | | **Données Techniques / Métriques** | Logs d'accès, IP pseudonymisées, Métriques Podman | **Faible** | Log rotation automatisé, anonymisation sous 30 jours. | --- ## 3. Stratégie de Pseudonymisation & Anonymisation Afin d'alimenter les modèles de Machine Learning tout en protégeant la vie privée des utilisateurs : 1. **Jetons de Pseudonymisation (Tokenization)** : * L'identité réelle de l'utilisateur est dissociée de son profil physiologique via un identifiant unique universel (UUID) irréversible stocké dans un coffre-fort d'identités chiffré. 2. **Pipelines d'Anonymisation pour la Recherche / ML** : * Les jeux de données d'entraînement pour les modèles ML sont extraits sans aucune référence personnelle. * Injection de bruits contrôlés (Confidentialité Différentielle / *Differential Privacy*) sur les séries temporelles lors des analyses agrégées. --- ## 4. Gouvernance & Éthique du Machine Learning (ML) Afin d'éviter tout effet "Boîte Noire" et de garantir un audit carré exigé par l'INRIA : * **Explicabilité & Traçabilité des Décisions** : * Chaque recommandation générée par le modèle (ex: ajustement de charge d'entraînement) est accompagnée de ses facteurs explicatifs (ex: baisse de la VRC de X% + augmentation de la charge aiguë). * **Auditabilité des Modèles** : * Les poids des modèles, les hyperparamètres et les jeux de données d'entraînement anonymisés sont versionnés (Model Registry). * **Supervision Humaine (*Human-in-the-loop*)** : * L'algorithme agit comme un système d'aide à la décision. L'athlète ou le coach conserve toujours le contrôle final sur l'ajustement de son programme. --- ## 5. Droits des Personnes & Cycle de Vie des Données * **Portabilité & Exportation** : L'utilisateur peut exporter l'intégralité de ses données sous un format standard ouvert (JSON / CSV) à tout moment. * **Droit à l'Oubli** : La suppression du compte entraîne la purge physique et définitive de l'ensemble des clés de déchiffrement associées aux données de l'utilisateur (*Crypto-shredding*). * **Durée de Conservation** : * Données actives : Conservées durant la durée d'utilisation du service. * Données anonymisées de recherche : Conservées sous forme non identifiable pour l'amélioration continue des modèles.