"You are a helpful assistant"
Toutes les entreprises fonctionnent désormais avec des réponses d'IA que personne ne vérifie. Je conçois, construis et mesure les systèmes qui vous disent quand votre IA a raison, quand elle a tort, et combien elle coûte. Mesuré — pas promis.
Les entreprises déploient des modèles sur des océans de résultats non vérifiés : faits obsolètes, défaillances silencieuses, compteurs qui tournent. Je transforme ce chaos en IA gouvernée, mesurée, digne de décision — des systèmes où chaque réponse porte ses preuves, chaque exécution porte son coût, et chaque affirmation survit à l'inspection. La plupart des fournisseurs d'IA livrent un instantané. Je livre un système vivant : quand vos données changent, le changement est détecté, l'impact mesuré, les réponses re-certifiées.
cat 01_the_system.md
Cinq étapes, une règle : le modèle propose, le système dispose. Touchez une étape pour l'inspecter.
Réponses brutes, documents et flux de données sont figés tels qu'ils ont été vus. Rien n'est encore fiable, tout peut être rejoué octet par octet.
Les faits sont calculés de manière déterministe, en dehors du modèle. Le LLM rédige la prose — il n'a jamais le droit d'inventer un chiffre.
Précision, fraîcheur, coût par exécution — selon des protocoles fixés avant tout appel, sur des jeux de test jamais utilisés pour l'ajustement. Un coût inconnu est traité comme un échec.
Approbations humaines signées, plafonds de budget stricts, résistance à l'injection de prompt testée comme une exigence. Les garde-fous vivent dans le code — jamais dans les prompts.
Chaque mission se termine par des chiffres que vous pourriez publier tels quels — y compris les limites, la confiance, et ce qui n'a pas pu être vérifié.
ls ./02_capabilities
Des missions à périmètre fixe avec des livrables mesurables. Vous savez toujours ce que vous obtiendrez, quand — et comment nous saurons, vous et moi, que ça fonctionne.
/ 01
Un jour, sur vos données réelles. Je mesure où votre IA se trompe, est obsolète ou trop chère — par rapport à une vérité terrain construite pour votre métier. Vous repartez avec un rapport chiffré et une réponse directe : API ou votre propre modèle, et exactement ce que cela devrait coûter.
1 900 $ — intégralement déduit de la réalisation.
/ 02
Votre IA, déployée et mesurée. Le bon moteur pour chaque tâche — les API de pointe là où elles sont nécessaires, votre propre petit modèle là où la confidentialité, le coût ou la stabilité l'emportent. La fiabilité est mesurée par rapport à votre vérité terrain avant la livraison, pas après que vos clients l'ont remarquée. Et ça continue de fonctionner après la passation : les changements de données sont détectés, l'impact mesuré, les réponses re-certifiées.
Benchmarks convenus par écrit avant l'entraînement — sinon vous ne payez pas.
6 000–12 000 $ — prix fixe convenu à l'avance.
/ 03
Votre IA reste affûtée, mesurablement. Surveillance continue par rapport à votre vérité terrain, mises à jour et réentraînement du modèle au fil de l'évolution de vos données, un rapport chiffré chaque mois, support direct.
999 $/mois — résiliable à tout moment.
./03_proof --numbers
J'applique à mon propre travail exactement ce que je vends : tout mesurer, publier les résultats — y compris ceux qui ne me flattent pas.
0
réponses obsolètes servies
Un système de réparation après changement de données que j'ai construit : 100 % de rappel d'invalidation là où la baseline par index en capturait ~57 % et servait 11 réponses obsolètes sur 40.
1 147
tests automatisés
Sur un SaaS IA de qualité production construit en 20 jours — avec 19 records de décisions d'architecture et un pipeline entièrement reproductible.
18 448
juges humains, 43 pays
Des données humaines réelles utilisées pour calibrer et valider la recherche utilisateur synthétique — avec des jeux de test jamais utilisés pour l'ajustement.
0,05 $
coût mesuré par exécution
Chaque pipeline que je construis rapporte son coût réel en tokens par exécution. Un coût inconnu est traité comme un échec, pas comme une estimation.
Je publie aussi des résultats négatifs : des benchmarks où ma propre approche a scoré au niveau du hasard, des scoreurs invalidés, des hypothèses échouées. C'est ce que « mesuré » veut dire.
ssh hello@tonytautai.com
Commencez par email — dites-moi ce que fait votre IA, vous obtenez une première lecture mesurée sous 48 h. Je travaille uniquement par email et WhatsApp : ni appels, ni visio. Pas une limite — une méthode. Chaque engagement, chaque chiffre, chaque décision reste consigné, et vous pouvez m'y tenir. Chaque mission commence de la même façon : périmètre écrit, prix fixe, contrat et facture de Nwbrains LLC — avant tout paiement.