Building & Running AI intermediate

On-Device AI

Also called: edge AI, local AI

Running a model on a phone or laptop instead of sending data to a server.

L’inférence sur l’appareil garde les données en local, fonctionne hors ligne et n’a aucun coût au token — vraiment séduisant pour la confidentialité et les contextes réglementés. La contrepartie est la capacité : les modèles locaux sont plus petits et plus lents que les API de pointe. La quantification et la distillation sont ce qui rend la chose viable.

En pratique : Transcrire une réunion confidentielle sans que l’audio quitte l’ordinateur portable.

Where this comes up