KI & Machine Learning
RAG, Agenten, MCP, selbstgehostete Modelle, klassisches ML
Den Proof of Concept habe ich selbst geschrieben und dann zwei Jahre daran gearbeitet, dass er an einem Dienstagmorgen ohne mich läuft. Die Demo ist die leichte Hälfte.
- ~60%des AI-SmartTalk-Produktcodes, von mir geschrieben
- 37Sprachen, in denen produktive Assistenten antworten
- 2023baue ich KI-Systeme — nach zehn Jahren Full-Stack
Retrieval, das echte Dokumente überlebt
RAG auf PostgreSQL und pgvector: Chunking, Embeddings, Re-Ranking, inkrementelle Neuindizierung. Die Vektorsuche ist nie das Schwierige. Schwierig wird es, wenn sich das Quelldokument um drei Uhr morgens ändert und niemand dem Index Bescheid sagt.
Agenten und Werkzeuge, in beide Richtungen
LangChain- und LangGraph-Workflows, und MCP gleich zweimal umgesetzt: als Tool-Server, den Kunden aufrufen, und als OAuth-Client fremder Server. Ein Assistent, der nichts tun kann, ist eine Suchleiste mit besseren Manieren.
Modelle, die Sie selbst hosten können
Ollama, vLLM, llama.cpp, On-Premise- und vollständig selbstgehostete Installationen. Wenn die Daten die Infrastruktur des Kunden nicht verlassen dürfen, ist ein API-Schlüssel keine Architektur. AnonDocs entstand aus derselben Bedingung: ein MIT-Anonymisierer, der Namen, E-Mails und Kennungen maskiert, bevor ein Prompt das Netz verlässt — von Wired Italia erwähnt.
Nicht nur LLMs, und nicht erst seit gestern
Bei Redspher: Preisprognosemodelle in Python und TensorFlow, kombiniert mit einem Bin-Packing-Solver, direkt in die Bestellstrecke verdrahtet — 40 % des Nutzfahrzeugeinkaufs automatisiert. Klassisches ML in Produktion, gemessen an den Bestellungen, die es erzeugt hat.
Stack
- Python
- pgvector
- embeddings · chunking · re-ranking
- LangChain
- LangGraph
- MCP
- Anthropic API
- OpenAI API
- evals
- Ollama
- vLLM
- llama.cpp
- TensorFlow