Nollie AI Gateway
SP-GATEWAY / ON-PREM INFERENCE
--:--:-- LIVE
Private AI compute, in real time

모든 추론이 하나의 관문을 지납니다

널리AI의 서비스와 에이전트가 보내는 요청은 sp-gateway 하나를 거쳐 사내 DGX Spark 클러스터로 흘러갑니다. 게이트웨이는 살아 있는 기기를 골라 보내고, 한 대가 멈추면 다음 기기로 넘깁니다. 아래 화면은 지금 이 순간의 흐름입니다.

Tokens processed
0
누적 처리 토큰
Requests served
0
누적 요청
Live throughput
0tok/s
지금 생성 속도
Median latency
-s
요청당 중앙값
Success, 24h
-%
최근 24시간 성공률
Live topology

실시간 연산망

서비스 중 대기 오프라인 도입 예정
Last 2 hours

분당 토큰 흐름

입력출력
Last 30 days

일별 요청

Last 48 hours

시간대별 요청

TODAY
0
LAST HOUR
0
FIRST TOKEN P50
-
01 / ROUTE

역할로 부르고, 기기는 게이트웨이가 고릅니다

서비스는 모델 주소 대신 mainllm, subllm 같은 역할 이름만 압니다. 모델을 바꾸거나 기기를 늘려도 서비스 코드는 그대로입니다.

02 / FAILOVER

한 대가 멈춰도 흐름은 멈추지 않습니다

30초마다 모든 기기를 살피고, 요청 중 연결이 끊기면 그 자리에서 다음 기기로 넘깁니다.

03 / OBSERVE

모든 요청은 기록됩니다

요청마다 걸린 시간, 첫 토큰까지의 시간, 처리한 토큰을 남깁니다. 프롬프트와 답변 본문은 남기지 않습니다.