Tous les tags

#llm

4 articles

·5 min

De la démo à l'outil : brancher un Space Hugging Face sur le protocole MCP

Nous avions deux démos sur Hugging Face — un extracteur de JSON sous contrainte et un auditeur de code adversarial. Jolies, mais passives : on les regarde, on clique. La vraie question est venue après : et si un agent pouvait les appeler tout seul ? C'est exactement ce que permet le MCP. Voici comment nous avons transformé deux Spaces Gradio en outils invocables depuis le terminal — avec le faux pas qui a planté l'un d'eux, et le moment où la vitrine est devenue un atelier.

ia-localellmmcphugging-facegradioagentszerogputool-useoutillage
Lire
·6 min

Tuer les faux positifs : un SAST LLM où une seconde IA réfute la première

Demande à un LLM de trouver les vulnérabilités d'un bout de code et il t'en trouvera — trop. Des injections SQL sur des requêtes déjà sûres, des failles sur du code mort. Le vrai se noie dans le bruit, et on finit par tout ignorer. Notre deuxième Space Hugging Face attaque ce problème de front : une passe détecte large, une seconde passe *adversariale* essaie de réfuter chaque trouvaille. Ce qui survit est réel, et arrive avec un exploit. Voici comment, et le faux pas de calibrage qui a failli tout fausser.

ia-localellmsecuritesastaudit-codehugging-facezerogpuoutlinesagentsdefensif
Lire
·8 min

Forcer un LLM à respecter un schéma : notre première démo Hugging Face

On voulait une démo qui prouve une chose simple : qu'un petit modèle peut produire du JSON qui respecte toujours un schéma — pas souvent, toujours. L'idée a tenu en un après-midi ; la mise en ligne nous a appris deux choses que la théorie ne dit pas. Que le CPU gratuit d'un hébergeur a un plancher qu'aucune optimisation ne franchit. Et que la démo et le produit ne veulent pas le même modèle. Voici comment on est passés d'un Space à 50 secondes par requête à un autre à deux, et ce que la contrainte garantit vraiment.

ia-localellmstructured-outputconstrained-decodinghugging-facezerogpuoutlinesgradioportfolio
Lire
·6 min

Un LLM hors-ligne qui cite ses sources : on a branché Ollama sur Kiwix

Un modèle qui tourne sur notre RTX 3090 a un défaut structurel : ses poids sont figés au jour de son entraînement. Coupez Internet et il raisonne encore très bien, mais il devient incertain sur les faits. Nous avions déjà les deux moitiés de la réponse sous la main — une bibliothèque ZIM servie par Kiwix, et Ollama sur le GPU. Voici comment nous les avons branchées l'une sur l'autre pour obtenir un assistant qui sait des choses justes, sans le moindre paquet qui sort du LAN. Avec les deux faux pas qui nous ont coûté l'après-midi.

self-hostingia-localeragollamakiwixofflinellmhomelabsouveraineté
Lire