Aller au contenu principal
01

IA & Machine Learning

RAG, agents, MCP, modèles auto-hébergés, ML classique

J’ai écrit la preuve de concept moi-même, puis j’ai passé deux ans à en faire quelque chose qui tourne un mardi matin sans moi. La démo, c’est la moitié facile.

  • ~60%du code produit d’AI SmartTalk, écrit par moi
  • 37langues traitées, sur des assistants en production
  • 2023je construis des systèmes IA depuis — après dix ans de full-stack

Une recherche qui survit aux vrais documents

RAG sur PostgreSQL et pgvector : découpage, embeddings, re-ranking, réindexation incrémentale. La recherche vectorielle n’est jamais le point dur. Le point dur, c’est ce qui se passe quand le document source change à trois heures du matin et que personne ne prévient l’index.

Des agents et des outils, dans les deux sens

Workflows LangChain et LangGraph, et MCP implémenté deux fois : en serveur d’outils que les clients appellent, et en client OAuth de serveurs tiers. Un assistant qui ne peut agir sur rien, c’est une barre de recherche avec de meilleures manières.

Des modèles que vous pouvez héberger vous-même

Ollama, vLLM, llama.cpp, installations on-premise et entièrement auto-hébergées. Quand les données n’ont pas le droit de sortir de l’infrastructure du client, une clé d’API n’est pas une architecture. AnonDocs est né de la même contrainte : un anonymiseur MIT qui masque noms, e-mails et identifiants avant que le prompt ne quitte le réseau, cité par Wired Italia.

Pas que du LLM, et pas depuis hier

Chez Redspher, des modèles de prédiction de prix en Python et TensorFlow combinés à un solveur de bin-packing, branchés directement dans le pipeline de commande : 40 % des achats de véhicules routiers automatisés. Du ML classique en production, jugé sur les bons de commande qu’il produisait.

Stack

  • Python
  • pgvector
  • embeddings · chunking · re-ranking
  • LangChain
  • LangGraph
  • MCP
  • Anthropic API
  • OpenAI API
  • evals
  • Ollama
  • vLLM
  • llama.cpp
  • TensorFlow