#ia-locale
4 articles
De la démo à l'outil : brancher un Space Hugging Face sur le protocole MCP
Nous avions deux démos sur Hugging Face — un extracteur de JSON sous contrainte et un auditeur de code adversarial. Jolies, mais passives : on les regarde, on clique. La vraie question est venue après : et si un agent pouvait les appeler tout seul ? C'est exactement ce que permet le MCP. Voici comment nous avons transformé deux Spaces Gradio en outils invocables depuis le terminal — avec le faux pas qui a planté l'un d'eux, et le moment où la vitrine est devenue un atelier.
Tuer les faux positifs : un SAST LLM où une seconde IA réfute la première
Demande à un LLM de trouver les vulnérabilités d'un bout de code et il t'en trouvera — trop. Des injections SQL sur des requêtes déjà sûres, des failles sur du code mort. Le vrai se noie dans le bruit, et on finit par tout ignorer. Notre deuxième Space Hugging Face attaque ce problème de front : une passe détecte large, une seconde passe *adversariale* essaie de réfuter chaque trouvaille. Ce qui survit est réel, et arrive avec un exploit. Voici comment, et le faux pas de calibrage qui a failli tout fausser.
Forcer un LLM à respecter un schéma : notre première démo Hugging Face
On voulait une démo qui prouve une chose simple : qu'un petit modèle peut produire du JSON qui respecte toujours un schéma — pas souvent, toujours. L'idée a tenu en un après-midi ; la mise en ligne nous a appris deux choses que la théorie ne dit pas. Que le CPU gratuit d'un hébergeur a un plancher qu'aucune optimisation ne franchit. Et que la démo et le produit ne veulent pas le même modèle. Voici comment on est passés d'un Space à 50 secondes par requête à un autre à deux, et ce que la contrainte garantit vraiment.
Un LLM hors-ligne qui cite ses sources : on a branché Ollama sur Kiwix
Un modèle qui tourne sur notre RTX 3090 a un défaut structurel : ses poids sont figés au jour de son entraînement. Coupez Internet et il raisonne encore très bien, mais il devient incertain sur les faits. Nous avions déjà les deux moitiés de la réponse sous la main — une bibliothèque ZIM servie par Kiwix, et Ollama sur le GPU. Voici comment nous les avons branchées l'une sur l'autre pour obtenir un assistant qui sait des choses justes, sans le moindre paquet qui sort du LAN. Avec les deux faux pas qui nous ont coûté l'après-midi.