Évaluer la fiabilité de vos modèles
C'est notre différenciateur, et il sort du périmètre strictement exigé par le règlement. L'idée est simple : la conformité documentaire dit ce qu'un système devrait faire, l'évaluation regarde ce qu'il fait.
Ce que mesure l'évaluation
Quatre dimensions, dans l'esprit de l'article 15 (exactitude, robustesse et cybersécurité) :
- Exactitude — les réponses sont-elles justes, sur une vérité-terrain que vous fournissez ?
- Robustesse — le modèle tient-il face à des entrées aberrantes, ambiguës ou mal formées ?
- Équité — les performances varient-elles selon les sous-populations ?
- Sécurité — le modèle résiste-t-il aux tentatives de détournement de ses consignes ?
Vous importez vos jeux de tests, la plateforme exécute et restitue les résultats.
Souveraineté
L'évaluation fonctionne via un endpoint compatible OpenAI, et cible Mistral souverain (Infomaniak) pour rester en Union européenne. Évaluer un modèle de santé en envoyant les données hors UE serait un contresens.
Ce que l'évaluation n'est pas
Nous préférons le dire nous-mêmes : un outil de conformité qui surpromet est le pire des outils de conformité.
Questions fréquentes
L'évaluation remplace-t-elle la validation clinique ?
Non, en aucun cas. La validation clinique relève du fournisseur du dispositif médical. L'évaluation de fiabilité est un outil de pilotage et de surveillance, utile au déployeur pour observer le comportement réel du système, sans valeur de certification.
Les données d'évaluation quittent-elles l'Union européenne ?
Non. L'évaluation cible un modèle Mistral souverain hébergé chez Infomaniak, en Union européenne.
Voyez-le sur vos propres systèmes
Aegida cartographie, qualifie et pilote la conformité de vos systèmes d'IA. Démonstration interactive, données fictives, sans inscription.
Voir la démonstration
Aegida