sudtechjobs. RÉGION · PACA

Principal LLM Inference Engineer - F/H

Atos — Sophia Antipolis

Sophia AntipolisCDI7–10 anspubliée le 03/09/202680000–95000 EUR
FastAPIGrafanaKubernetesFoundationDeepSeekTensorRTHelmDockerLlamaPythonPrometheus
Postuler en direct

• Serving et Runtime des modèles : Concevoir et optimiser la plateforme de serving basée sur vLLM, configurer le parallélisme selon l'architecture du modèle et l'interconnexion de l'infrastructure cible, et installer/maintenir llm-d pour l'inférence distribuée et désagrégée (préremplissage/décodage désagrégés, routage conscient du cache KV).

• Cycle de vie et pipelines multimodaux : Maîtriser le cycle de vie des modèles en plateforme (versioning, déploiement progressif, rollback) y compris en environnements isolés, et servir des pipelines multimodaux (audio temps réel, STT, TTS, OCR) ainsi que des services d'embedding et de reranking (bases vectorielles comme Milvus).

• Fiabilité, Observabilité et Benchmarking : Instrumenter la couche de serving avec Prometheus et Grafana (métriques GPU et par token, logs structurés, traçabilité), mettre en place des déploiements canary/blue-green avec portes d'évaluation automatisées, et mener des campagnes de benchmarking structurées pour suivre et réduire le coût par token et la latence de queue.

• Support Avant-Vente et Dimensionnement : Fournir des données de dimensionnement et de performance défendables pour appuyer les activités d'avant-vente, les appels d'offres et la planification de capacité.

Profil recherché

Description du profil :

Compétences et qualifications

• Expérience : Solide parcours (généralement 7+ ans d’expérience en ingénierie avec un temps significatif dédié au serving de modèles ML/AI) dans la construction et l’exploitation d’inférences LLM en production.

•…

Avantages

→ Toutes les offres Data / IA en PACA