Rym_Gouvernance/iso27001/POLITIQUE_TRAITEMENT_DONNEE...

3.7 KiB

Politique de Traitement des Données & Gouvernance ML

1. Cadre Général & Engagement Privacy-by-Design

Le projet RYM / Peakload traite des données relatives à la pratique sportive, à la physiologie et au suivi de la performance. Conformément au RGPD (Règlement Général sur la Protection des Données) et aux directives d'éthique de la recherche (INRIA / CNIL) :

  • Minimisation des données : Seules les métriques strictement nécessaires à l'analyse de la charge et à la prévention des blessures sont collectées.
  • Chiffrement de bout en bout : Toutes les données personnelles et physiologiques sont chiffrées en transit (TLS 1.3) et au repos (AES-256).
  • Isolation des environnements : Séparation stricte entre les données de production, les jeux de données de test et les environnements de recherche.

2. Classification des Données Traitées

Catégorie de Donnée Exemples Niveau de Sensibilité Mesures de Protection
Données Identifiantes Email, Nom, Prénom, Identifiant unique Élevé Stockage chiffré, séparé des données de performance.
Données Physiologiques VRC, Fréquence Cardiaque, Sommeil, Fatigue (RPE) Très Élevé (Données de Santé) Pseudonymisation à la source, accès restreint aux micro-services ML.
Données d'Activité Charge d'entraînement, Durée, Type de sport Moyen Agrégation et horodatage chiffré.
Données Techniques / Métriques Logs d'accès, IP pseudonymisées, Métriques Podman Faible Log rotation automatisé, anonymisation sous 30 jours.

3. Stratégie de Pseudonymisation & Anonymisation

Afin d'alimenter les modèles de Machine Learning tout en protégeant la vie privée des utilisateurs :

  1. Jetons de Pseudonymisation (Tokenization) :
    • L'identité réelle de l'utilisateur est dissociée de son profil physiologique via un identifiant unique universel (UUID) irréversible stocké dans un coffre-fort d'identités chiffré.
  2. Pipelines d'Anonymisation pour la Recherche / ML :
    • Les jeux de données d'entraînement pour les modèles ML sont extraits sans aucune référence personnelle.
    • Injection de bruits contrôlés (Confidentialité Différentielle / Differential Privacy) sur les séries temporelles lors des analyses agrégées.

4. Gouvernance & Éthique du Machine Learning (ML)

Afin d'éviter tout effet "Boîte Noire" et de garantir un audit carré exigé par l'INRIA :

  • Explicabilité & Traçabilité des Décisions :
    • Chaque recommandation générée par le modèle (ex: ajustement de charge d'entraînement) est accompagnée de ses facteurs explicatifs (ex: baisse de la VRC de X% + augmentation de la charge aiguë).
  • Auditabilité des Modèles :
    • Les poids des modèles, les hyperparamètres et les jeux de données d'entraînement anonymisés sont versionnés (Model Registry).
  • Supervision Humaine (Human-in-the-loop) :
    • L'algorithme agit comme un système d'aide à la décision. L'athlète ou le coach conserve toujours le contrôle final sur l'ajustement de son programme.

5. Droits des Personnes & Cycle de Vie des Données

  • Portabilité & Exportation : L'utilisateur peut exporter l'intégralité de ses données sous un format standard ouvert (JSON / CSV) à tout moment.
  • Droit à l'Oubli : La suppression du compte entraîne la purge physique et définitive de l'ensemble des clés de déchiffrement associées aux données de l'utilisateur (Crypto-shredding).
  • Durée de Conservation :
    • Données actives : Conservées durant la durée d'utilisation du service.
    • Données anonymisées de recherche : Conservées sous forme non identifiable pour l'amélioration continue des modèles.