널리AI의 서비스와 에이전트가 보내는 요청은 sp-gateway 하나를 거쳐 사내 DGX Spark 클러스터로 흘러갑니다. 게이트웨이는 살아 있는 기기를 골라 보내고, 한 대가 멈추면 다음 기기로 넘깁니다. 아래 화면은 지금 이 순간의 흐름입니다.
서비스는 모델 주소 대신 mainllm, subllm 같은 역할 이름만 압니다. 모델을 바꾸거나 기기를 늘려도 서비스 코드는 그대로입니다.
30초마다 모든 기기를 살피고, 요청 중 연결이 끊기면 그 자리에서 다음 기기로 넘깁니다.
요청마다 걸린 시간, 첫 토큰까지의 시간, 처리한 토큰을 남깁니다. 프롬프트와 답변 본문은 남기지 않습니다.