Parcourir les guides

Articles AI Glossary

162

Débit (throughput)

Le débit est la question de la capacité, distincte de la question de vitesse que pose la latence. Le batching augmente le débit tout en augmentant la latence individuelle, ce qui est exactement l’arbitrage voulu pour des traitements hors ligne et exactement le mauvais pour du chat. En pratique : Lancer un million de classifications en batch pendant la nuit ; personne ne regarde l’horloge.

Découpage (chunking)

Le découpage est l’étape la moins glamour et la plus lourde de conséquences d’un pipeline RAG. Des chunks trop grands diluent l’embedding et gaspillent du contexte ; trop petits, ils perdent le sens qui les rendait pertinents. Découper selon la structure — titres, sections — vaut mieux que découper au nombre de caractères. En pratique : Couper un contrat au milieu d’une clause, si bien que la recherche renvoie une demi-phrase qui ne veut rien dire. ...

Deepfake

Les deepfakes combinent la génération vidéo ou le clonage de voix avec l’apparence d’une personne réelle. La détection est peu fiable et se dégrade, si bien que les défenses concrètes sont les signaux de provenance, les canaux de vérification et les processus internes. Le règlement européen sur l’IA impose des obligations de divulgation pour ce type de contenu. En pratique : Une voix de PDG clonée qui, au téléphone, autorise un virement. ...

Déployeur

Si votre entreprise utilise un système d’IA au travail, vous êtes probablement un déployeur. L’usage purement personnel et non professionnel est exclu. Les obligations du déployeur sont plus légères que celles du fournisseur, mais bien réelles pour les systèmes à haut risque : l’utiliser conformément à la notice, confier le contrôle humain à des personnes compétentes, conserver les journaux et informer les personnes concernées. En pratique : Une équipe RH qui utilise un outil tiers de tri de CV est déployeuse d’un système à haut risque. ...

Dérive du modèle

La dérive survient parce que la réalité change : les comportements clients évoluent, le vocabulaire évolue, un concurrent se lance. Le modèle, lui, est inchangé, mais sa justesse se dégrade en silence. Le danger, c’est qu’il échoue sans produire d’erreur, si bien que seule la surveillance le détecte. En pratique : Une prévision de demande entraînée avant l’inflation, qui continue de renvoyer des chiffres assurés et faux.

Descente de gradient

La descente de gradient calcule dans quelle direction chaque paramètre doit se déplacer pour réduire la perte, puis fait un petit pas dans ce sens. Répétez des millions de fois et le modèle converge. Presque tout l’entraînement moderne en utilise une variante, généralement Adam. En pratique : Comme descendre une colline dans le brouillard : vous ne voyez pas la vallée, mais vous sentez la pente sous vos pieds.

Distillation

Dans la distillation, un grand modèle enseignant produit des sorties qui servent à entraîner un modèle élève plus petit. L’élève finit moins cher et plus rapide tout en conservant une bonne part du comportement de l’enseignant sur la distribution visée. La plupart des modèles de production abordables sont distillés à partir de plus gros. En pratique : Un modèle 10× plus petit et 20× moins cher qui traite 90% de votre trafic tout aussi bien. ...

Documentation technique

L’article 11 et l’annexe IV précisent ce que le dossier doit contenir : description du système, choix de conception, données, entraînement et tests, indicateurs de performance, gestion des risques et plan de suivi après commercialisation. Il doit exister avant la mise sur le marché et être tenu à jour ensuite. C’est l’artefact de conformité — pas de dossier, pas de conformité. En pratique : Le document qu’une autorité réclame en premier, et que les équipes commencent à rédiger bien trop tard. ...

Données d'entraînement

Les données d’entraînement sont le corpus utilisé pour ajuster les paramètres d’un modèle. Leur couverture fixe le plafond du modèle : les manques, les erreurs et les déséquilibres des données réapparaissent en manques, erreurs et biais dans les sorties. Dans l’AI Act européen, les données d’entraînement ont une définition formelle et, pour les systèmes à haut risque, des obligations de gouvernance attachées. En pratique : Un modèle de recrutement entraîné surtout sur des embauches passées issues d’un seul profil démographique reproduira ce schéma. ...

Données de test

Les données de test sont le bulletin de notes honnête. Elles doivent rester intactes pendant le développement, car toute décision prise sur la base des résultats de test les transforme en données de validation. Quand des exemples de test fuitent dans l’entraînement — la contamination —, les scores annoncés ne veulent plus rien dire. En pratique : Un modèle qui obtient 95 % sur un benchmark dont les réponses figuraient dans ses données d’entraînement n’a rien appris. ...