·8 min
Forcer un LLM à respecter un schéma : notre première démo Hugging Face
On voulait une démo qui prouve une chose simple : qu'un petit modèle peut produire du JSON qui respecte toujours un schéma — pas souvent, toujours. L'idée a tenu en un après-midi ; la mise en ligne nous a appris deux choses que la théorie ne dit pas. Que le CPU gratuit d'un hébergeur a un plancher qu'aucune optimisation ne franchit. Et que la démo et le produit ne veulent pas le même modèle. Voici comment on est passés d'un Space à 50 secondes par requête à un autre à deux, et ce que la contrainte garantit vraiment.
ia-localellmstructured-outputconstrained-decodinghugging-facezerogpuoutlinesgradioportfolio
Lire →