Associate AI Inference Engineer (m/f/d/x) - #2726812

T-Systems International


Date: vor 1 Stunde
Stadt: Hamburg
Vertragstyp: Ganztags
Arbeitsplan: Volle Tag
T-Systems International
Über die Position

T-Systems baut Europas nächste Generation von KI-Infrastruktur mit der AI Industry Cloud auf, die von Tausenden NVIDIA-GPUs betrieben wird, darunter NVIDIA DGX B200- und B300-Systeme der neuesten Generation. Unsere Plattform ermöglicht es Unternehmen, modernste Large Language Models (LLMs) und Generative-AI-Anwendungen auf einer sicheren und hochperformanten Infrastruktur bereitzustellen, zu skalieren und zu betreiben.

Wir suchen einen Associate AI Inference Engineer zur Verstärkung unseres AI-Platform-Teams. In dieser Rolle unterstützt du die Bereitstellung, den Betrieb und die Optimierung produktiver LLM-Inference-Services auf Basis der T-Systems AI Foundation Plattform, die auf der Industrial AI Cloud betrieben wird. In enger Zusammenarbeit mit Plattform-Ingenieuren, AI Researchern und Softwareentwicklern trägst du dazu bei, hochperformante und zuverlässige KI-Services für Unternehmenskunden bereitzustellen.

Diese Position eignet sich insbesondere für Berufseinsteiger mit praktischer Erfahrung im Bereich LLM Inference, die mit moderner NVIDIA-GPU-Infrastruktur und produktiven KI-Systemen in großem Maßstab arbeiten möchten.

Aufgaben

  • Bereitstellung, Konfiguration und Betrieb produktiver LLM-Inference-Services auf Basis der T-Systems AI Foundation Plattform.
  • Optimierung von Inference-Workloads auf NVIDIA-GPU-Infrastruktur hinsichtlich Latenz, Durchsatz und GPU-Auslastung.
  • Benchmarking und Evaluierung von LLM-Serving-Frameworks, Inference-Konfigurationen und Model Deployments.
  • Implementierung und Optimierung moderner LLM-Serving-Techniken wie KV-Cache-Optimierung, Continuous Batching und Distributed Inference.
  • Zusammenarbeit mit Plattform-Ingenieuren bei der Bereitstellung und Skalierung von AI-Workloads auf Kubernetes.
  • Analyse und Behebung von Performance-Problemen im Inference-Betrieb über Software-, Netzwerk- und GPU-Infrastruktur hinweg.
  • Mitwirkung bei der Automatisierung von Deployment-, Benchmarking- und Betriebsprozessen.
  • Monitoring von Inference-Services mithilfe von Metriken, Logging und Dashboards zur Sicherstellung eines zuverlässigen Produktivbetriebs.
  • Enge Zusammenarbeit mit AI Engineers und Researchern beim Onboarding neuer Foundation Models und Inference-Technologien.
  • Pflege der technischen Dokumentation und Mitwirkung an der kontinuierlichen Weiterentwicklung der AI-Inference-Plattform.

Must-Have Skills

  • Bachelorabschluss in Informatik, Elektrotechnik, Informationstechnologie oder einer vergleichbaren technischen Fachrichtung. Ein Masterabschluss in Künstlicher Intelligenz, Machine Learning oder einem verwandten Bereich ist von Vorteil.
  • Relevante praktische Erfahrung in AI Engineering, Machine Learning Engineering oder AI Infrastructure Engineering, einschließlich Erfahrung als Werkstudent oder Research Engineer.
  • Sehr gute Programmierkenntnisse in Python sowie Erfahrung in der Entwicklung von AI-Anwendungen und entsprechenden Tools.
  • Praktische Erfahrung bei der Bereitstellung, dem Benchmarking oder der Optimierung von Large-Language-Model-(LLM)-Inference-Workloads.
  • Praktische Erfahrung mit modernen LLM-Serving-Frameworks wie vLLM und SGLang.
  • Praktische Erfahrung bei der Optimierung von LLM-Inference-Workloads auf NVIDIA-GPU-Infrastruktur sowie Berührungspunkte mit NVIDIA-DGX/HGX-Systemen oder GPU-Plattformen der nächsten Generation wie B200 und B300.
  • Erfahrung mit der Evaluierung oder Optimierung fortgeschrittener Inference-Techniken wie KV Caching, Disaggregated Prefill/Decode Inference oder vergleichbaren LLM-Serving-Optimierungen.
  • Kenntnisse moderner NVIDIA-Inference-Technologien wie NVIDIA Dynamo, LMCache, TensorRT-LLM, Triton Inference Server oder vergleichbarer GPU-Inference-Frameworks.
  • Erfahrung im Benchmarking von AI-Modellen sowie in der Analyse von Inference-Performance, Latenz, Durchsatz und Serving-Effizienz.
  • Erfahrung mit Docker, Kubernetes, Bash und Linux-basierten Compute-Umgebungen.
  • Ausgeprägte analytische Fähigkeiten und Problemlösungskompetenz sowie die Fähigkeit zur Zusammenarbeit in multidisziplinären Engineering-Teams.
  • Reisebereitschaft von bis zu 50 %.
  • Internationale Erfahrung, beispielsweise durch Studium, Arbeit oder längere Auslandsaufenthalte.

Nice-to-Have Skills

  • Kenntnisse in CUDA, NCCL, NVLink, GPUDirect RDMA oder InfiniBand Networking.
  • Erfahrung im Betrieb produktiver AI-Services auf Kubernetes.
  • Kenntnisse von Observability-Tools wie Prometheus, Grafana und OpenTelemetry.
  • Erfahrung mit Helm, Terraform, GitHub Actions oder Infrastructure-as-Code.
  • Erfahrung mit Enterprise-AI-Plattformen oder Multi-Tenant-Inference-Umgebungen.
  • Kenntnisse im Bereich Retrieval-Augmented Generation (RAG), Vektordatenbanken oder Embedding-Retrieval-Systemen.

Was wir bieten

  • Die Möglichkeit, an einer der größten Enterprise-AI-Plattformen Europas mitzuarbeiten.
  • Arbeit mit modernster NVIDIA-AI-Infrastruktur, einschließlich DGX B200- und B300-Systemen.
  • Praktische Erfahrung mit modernen LLM-Inference-Technologien, darunter AI Foundation, vLLM, SGLang, TensorRT-LLM, NVIDIA Dynamo und LMCache.
  • Arbeit mit großen GPU-Clustern für Enterprise-AI-Workloads.
  • Zusammenarbeit mit erfahrenen AI Researchern, Plattform-Ingenieuren und Softwareentwicklern.
  • Möglichkeiten zur kontinuierlichen Weiterbildung sowie zur fachlichen und persönlichen Weiterentwicklung.
  • Ein kollaboratives Arbeitsumfeld, in dem Innovation, technische Exzellenz und Wissensaustausch gefördert

Über T-Systems International GmbH

Bei T-Systems bieten wir unseren Geschäftskunden die richtigen Systemlösungen für ihr digitales Business. Mit unserem Portfolio stellen wir sicher, dass digitale Transformation Komplexität reduziert, Kosten einspart und die alltägliche Arbeit erleichtert. Unsere Schwerpunkte sind Konnektivität, Digital, Cloud & Infrastruktur sowie Sicherheit - Let's power higher performance!

Dieser Job ist wie für Sie gemacht? Dann nutzen Sie Ihre Chance! Bewerben Sie sich bitte online. Schwerbehinderte Menschen werden bei gleicher Eignung vorrangig berücksichtigt. Wir freuen uns auf Sie!

None None

Wie bewerbe ich mich?

Um sich für diesen Job zu bewerben, müssen Sie auf unserer Website autorisieren. Wenn Sie noch kein Konto haben, registrieren Sie sich bitte.

Veröffentlichen Sie einen Lebenslauf

Ähnliche Jobs

Sales Engineer (m/f/d)

Danfoss,
vor 3 Minuten
Dein Beitrag bei uns Bei Danfoss Climate Solutions entwickeln wir innovative Technologien, die unseren Kunden helfen, Energie effizienter zu nutzen, Emissionen zu reduzieren und die Transformation zu nachhaltigeren Gebäuden und Infrastrukturen voranzutreiben. Als Sales Engineer (m/w/d) für Niedersachsen verbindest du...
Danfoss

Projektleiter Filialumbau & Rollout (m/w/d)

BLUME2000 SE,
vor 33 Minuten
Du bist ein echtes Organisationstalent, steuerst komplexe Projekte strukturiert und behältst auch bei vielen Beteiligten und parallelen Aufgaben den Überblick? Dann werde Teil unseres Filialbau-Teams am Standort in Norderstedt! Als Projektleiter Rollout neues Ladenbaukonzept (m/w/d) planst und koordinierst du innerhalb...
BLUME2000 SE

Kfz-Mechatroniker/Kfz-Monteur (w/m/d) Fahrzeugglas mit Betriebsleitungsfunktion in Hamburg - 385

Carglass GmbH,
€35,500 - €50,500 / Jahr
vor 4 Stunden
The role holder demonstrates core skills, knowledge, and competence in all role requirements, and is improving capability and proficiency Is technically trained for “Standard” jobs but may not have put all training into practice and is exposed to “complex” jobs...
Carglass GmbH