Rym_Gouvernance/iso27001/POLITIQUE_TRAITEMENT_DONNEE...

55 lines
3.7 KiB
Markdown

# Politique de Traitement des Données & Gouvernance ML
## 1. Cadre Général & Engagement Privacy-by-Design
Le projet RYM / Peakload traite des données relatives à la pratique sportive, à la physiologie et au suivi de la performance. Conformément au **RGPD (Règlement Général sur la Protection des Données)** et aux directives d'éthique de la recherche (INRIA / CNIL) :
* **Minimisation des données** : Seules les métriques strictement nécessaires à l'analyse de la charge et à la prévention des blessures sont collectées.
* **Chiffrement de bout en bout** : Toutes les données personnelles et physiologiques sont chiffrées en transit (TLS 1.3) et au repos (AES-256).
* **Isolation des environnements** : Séparation stricte entre les données de production, les jeux de données de test et les environnements de recherche.
---
## 2. Classification des Données Traitées
| Catégorie de Donnée | Exemples | Niveau de Sensibilité | Mesures de Protection |
| :--- | :--- | :--- | :--- |
| **Données Identifiantes** | Email, Nom, Prénom, Identifiant unique | **Élevé** | Stockage chiffré, séparé des données de performance. |
| **Données Physiologiques** | VRC, Fréquence Cardiaque, Sommeil, Fatigue (RPE) | **Très Élevé (Données de Santé)** | Pseudonymisation à la source, accès restreint aux micro-services ML. |
| **Données d'Activité** | Charge d'entraînement, Durée, Type de sport | **Moyen** | Agrégation et horodatage chiffré. |
| **Données Techniques / Métriques** | Logs d'accès, IP pseudonymisées, Métriques Podman | **Faible** | Log rotation automatisé, anonymisation sous 30 jours. |
---
## 3. Stratégie de Pseudonymisation & Anonymisation
Afin d'alimenter les modèles de Machine Learning tout en protégeant la vie privée des utilisateurs :
1. **Jetons de Pseudonymisation (Tokenization)** :
* L'identité réelle de l'utilisateur est dissociée de son profil physiologique via un identifiant unique universel (UUID) irréversible stocké dans un coffre-fort d'identités chiffré.
2. **Pipelines d'Anonymisation pour la Recherche / ML** :
* Les jeux de données d'entraînement pour les modèles ML sont extraits sans aucune référence personnelle.
* Injection de bruits contrôlés (Confidentialité Différentielle / *Differential Privacy*) sur les séries temporelles lors des analyses agrégées.
---
## 4. Gouvernance & Éthique du Machine Learning (ML)
Afin d'éviter tout effet "Boîte Noire" et de garantir un audit carré exigé par l'INRIA :
* **Explicabilité & Traçabilité des Décisions** :
* Chaque recommandation générée par le modèle (ex: ajustement de charge d'entraînement) est accompagnée de ses facteurs explicatifs (ex: baisse de la VRC de X% + augmentation de la charge aiguë).
* **Auditabilité des Modèles** :
* Les poids des modèles, les hyperparamètres et les jeux de données d'entraînement anonymisés sont versionnés (Model Registry).
* **Supervision Humaine (*Human-in-the-loop*)** :
* L'algorithme agit comme un système d'aide à la décision. L'athlète ou le coach conserve toujours le contrôle final sur l'ajustement de son programme.
---
## 5. Droits des Personnes & Cycle de Vie des Données
* **Portabilité & Exportation** : L'utilisateur peut exporter l'intégralité de ses données sous un format standard ouvert (JSON / CSV) à tout moment.
* **Droit à l'Oubli** : La suppression du compte entraîne la purge physique et définitive de l'ensemble des clés de déchiffrement associées aux données de l'utilisateur (*Crypto-shredding*).
* **Durée de Conservation** :
* Données actives : Conservées durant la durée d'utilisation du service.
* Données anonymisées de recherche : Conservées sous forme non identifiable pour l'amélioration continue des modèles.