Back to search
Toss Linkedin · Posted 12d ago

Systems Engineer (GPU)

Seoul

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

함께하게 될 팀에 대해 알려드려요

  • 토스의 System Platform 팀은 Network Engineer, InfraOps Engineer와 함께 Infra Engineering Tribe에 속해 있어요.
  • System Platform 팀은 IDC 베어메탈부터 퍼블릭 클라우드까지, 서비스가 올라가는 시스템 기반을 직접 설계하고 운영해요.
  • 이 포지션은 AI/ML 워크로드가 안정적으로 동작할 수 있는 GPU 인프라를 담당해요.
  • 어떤 GPU를 어떤 구조로 도입하고 어떻게 확장할지 판단하며 차세대 AI 인프라 로드맵을 함께 만들어가요.

합류하면 함께 할 업무예요

  • GPU 컴퓨팅 클러스터 인프라를 설계하고, 베어메탈부터 구축해 운영해요.
  • 최신 GPU 라인업과 아키텍처 변화를 추적하고, PoC와 벤치마크로 도입을 검증하며 인프라 로드맵을 세워요.
  • GPU 서버의 표준 OS와 소프트웨어 스택을 구성하고, 대규모 노드를 재현 가능하게 프로비저닝해요.
  • 고성능 네트워크와 스토리지를 설계해 클러스터 성능을 최적화해요.
  • GPU 자원을 모니터링하고, 장애를 진단하고 근본 원인을 찾아 대응하며 운영을 자동화해요.
  • 사용률과 용량 지표를 근거로 증설 시점을 판단해 전력, 냉각, 랙 등 인프라 환경을 고려하여 안정적으로 증설해요.

이런 분과 함께하고 싶어요.

  • 시스템 엔지니어로 3년 이상, 대규모 Linux 서버 인프라를 운영해 보신 분이면 좋아요.
  • OS, 커널, 드라이버 중 한 영역 이상을 깊이 다뤄 문제를 해결해 본 분이면 좋아요.
  • GPU 서버를 활용한 HPC 또는 AI 클러스터를 구축하고 운영해 본 경험이 있으신 분이면 좋아요.
  • 반복되는 운영을 코드로 자동화하고, 표준과 문서로 남겨 본 분이면 좋아요.
  • 여러 팀과 기술적인 논리에 기반해 협업할 수 있는 분이면 좋아요.

이런 경험이 있다면 더 좋아요

  • CUDA, NCCL, NVLink, RDMA와 같은 GPU 컴퓨팅 기술에 대한 이해가 있으면 더 좋아요.
  • InfiniBand 또는 RoCE 기반 고속 네트워크를 설계하고 운영해 본 경험이 있으면 더 좋아요.
  • 펌웨어, BIOS, BMC 등 하드웨어 레벨을 직접 다뤄본 경험이 있으면 더 좋아요.
  • DCGM, Prometheus, Grafana 등으로 모니터링 체계를 구축해 본 경험이 있으면 더 좋아요.
  • AI/ML 조직과 협업하거나 MLOps 파이프라인을 이해하고 있으면 더 좋아요.
  • IDC 전력, 냉각, 랙 등 물리 인프라를 고려해 대규모 컴퓨팅 환경을 설계해 본 경험이 있으면 더 좋아요.
Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search