LLM auto-hébergé & MLOps — POC DevOps × IA
L'angle. Croiser mon socle DevOps et l'IA : servir des modèles de langage en privé, sans dépendre d'une API tierce, avec la maîtrise des données et des coûts.
Ce que je prototype
- Serving de modèles ouverts via Ollama / vLLM, exposés en API OpenAI-compatible.
- Déploiement sur Kubernetes/k3s, gestion GPU et mise à l'échelle.
- Observabilité de l'inférence (latence, tokens/s, coût par requête).
- Cache, quantization et arbitrages coût/performance.
Stack
Ollama · vLLM · Kubernetes · Docker · GPU · API-first
POC — banc d'essai IA/MLOps, non déployé en production.