IA embarquée
L’inférence sur l’appareil garde les données en local, fonctionne hors ligne et n’a aucun coût au token — vraiment séduisant pour la confidentialité et les contextes réglementés. La contrepartie est la capacité : les modèles locaux sont plus petits et plus lents que les API de pointe. La quantification et la distillation sont ce qui rend la chose viable. En pratique : Transcrire une réunion confidentielle sans que l’audio quitte l’ordinateur portable. ...