Zum Hauptinhalt springen
01

KI & Machine Learning

RAG, Agenten, MCP, selbstgehostete Modelle, klassisches ML

Den Proof of Concept habe ich selbst geschrieben und dann zwei Jahre daran gearbeitet, dass er an einem Dienstagmorgen ohne mich läuft. Die Demo ist die leichte Hälfte.

  • ~60%des AI-SmartTalk-Produktcodes, von mir geschrieben
  • 37Sprachen, in denen produktive Assistenten antworten
  • 2023baue ich KI-Systeme — nach zehn Jahren Full-Stack

Retrieval, das echte Dokumente überlebt

RAG auf PostgreSQL und pgvector: Chunking, Embeddings, Re-Ranking, inkrementelle Neuindizierung. Die Vektorsuche ist nie das Schwierige. Schwierig wird es, wenn sich das Quelldokument um drei Uhr morgens ändert und niemand dem Index Bescheid sagt.

Agenten und Werkzeuge, in beide Richtungen

LangChain- und LangGraph-Workflows, und MCP gleich zweimal umgesetzt: als Tool-Server, den Kunden aufrufen, und als OAuth-Client fremder Server. Ein Assistent, der nichts tun kann, ist eine Suchleiste mit besseren Manieren.

Modelle, die Sie selbst hosten können

Ollama, vLLM, llama.cpp, On-Premise- und vollständig selbstgehostete Installationen. Wenn die Daten die Infrastruktur des Kunden nicht verlassen dürfen, ist ein API-Schlüssel keine Architektur. AnonDocs entstand aus derselben Bedingung: ein MIT-Anonymisierer, der Namen, E-Mails und Kennungen maskiert, bevor ein Prompt das Netz verlässt — von Wired Italia erwähnt.

Nicht nur LLMs, und nicht erst seit gestern

Bei Redspher: Preisprognosemodelle in Python und TensorFlow, kombiniert mit einem Bin-Packing-Solver, direkt in die Bestellstrecke verdrahtet — 40 % des Nutzfahrzeugeinkaufs automatisiert. Klassisches ML in Produktion, gemessen an den Bestellungen, die es erzeugt hat.

Stack

  • Python
  • pgvector
  • embeddings · chunking · re-ranking
  • LangChain
  • LangGraph
  • MCP
  • Anthropic API
  • OpenAI API
  • evals
  • Ollama
  • vLLM
  • llama.cpp
  • TensorFlow