THROUGHPUT / C4 → C16
동시성은 4배가 됐지만 처리량은 0.18%만 늘었습니다. 부하를 더 넣어도 처리량을 사지 못했습니다.
AXCOB LABLLM SERVING WORKLOAD REVIEW
24시간 요청 로그를 보내주세요. 실제 워크로드가 어디서 무너지는지 측정하고, 48시간 안에 라우팅과 입장 정책으로 돌려드립니다.
첫 3개 적격 워크로드 리뷰 무료 · 프롬프트 원문과 개인정보 불필요
LLAMA 3.1 70B FP8 · VLLM 0.19.1
FLASHATTENTION V3 · FP8 KV CACHE
01 / MEASURED EVIDENCE
THROUGHPUT / C4 → C16
동시성은 4배가 됐지만 처리량은 0.18%만 늘었습니다. 부하를 더 넣어도 처리량을 사지 못했습니다.
P99 TTFT / C4 → C16
같은 조건에서 꼬리 지연은 772% 늘었습니다. 실제 경계는 평균이 아니라 꼬리에 있었습니다.
MIXED WORKLOAD
같은 혼합 워크로드도 환경에 따라 결과가 달랐습니다. 보편값을 가정하지 않고 고객 환경에서 다시 재생해야 합니다.
처리량 plateau와 P99 TTFT 폭증은 두 번째 H100 SXM5 공급자에서도 같은 프로토콜로 재현됐습니다. 혼합 워크로드의 공정성 동작은 scheduler와 runtime에 민감해 고객별 replay가 필요했습니다.
재현 노트와 원본 데이터REVIEW PIPELINE
비식별 요청 로그의 형식과 누락을 확인합니다.
입력 길이와 동시성별로 워크로드를 나눕니다.
측정 경계와 SLO 기준으로 트래픽을 재생합니다.
라우팅·입장 판단을 검토 가능한 JSON으로 정리합니다.
평균 처리량은 대시보드가 보여줍니다.
02 / WHAT YOU SEND
request_id해시 처리한 고유 식별자도 괜찮습니다.
timestampISO 8601 또는 Unix epoch. UTC를 권장합니다.
input_tokens토큰화된 입력 길이. 추정값도 가능합니다.
output_tokens토큰화된 출력 또는 완료 길이입니다.
statussuccess, error, timeout 또는 같은 의미의 상태값입니다.
latency_ms종단 지연 시간. TTFT와 TPOT는 선택입니다.
아직 토큰 수를 기록하지 않는다면 prompt length나 비식별 샘플을 보내주세요. 추정 방법부터 함께 잡을 수 있습니다.
03 / WHAT YOU RECEIVE
요청 버킷별로 측정됨, 안전 상향, 측정 범위 밖, 지원되지 않는 모델·하드웨어를 구분합니다.
MATCH / COVERAGE / SOURCEinteractive, async, reject 분기와 입력 크기 임계값이 담긴 재생 가능한 JSON 정책을 제공합니다.
JSON / REVIEWER-LOCKEDchat, RAG, batch summarization 또는 자체 기준으로 로그를 재생하고 verdict와 SLO risk를 계산합니다.
REPLAY / VERDICT / RISK04 / OPEN RESEARCH
측정 방법론, 참조 corpus, 리뷰를 만드는 simulator를 GitHub에 공개했습니다. 고객에게 전달하는 결과도 같은 코드 경로에서 생성됩니다.
github.com/jacob-sunho-kim/llm-boundary-research TOOLKIT: MIT · RESEARCH ARTIFACTS: CC-BY-4.0참조 corpus는 아직 제한된 측정 환경에서 출발했습니다. GPU, 모델 계열, 양자화, 서빙 스택이 다르면 outside_measured_boundary로 명시합니다. 첫 3건을 무료로 진행하는 이유도 실제 워크로드에서 무엇을 더 측정해야 하는지 함께 배우기 위해서입니다.
START A REVIEW
처리량 변화(+0.18%)와 TTFT 변화(+772%)는 명시한 하드웨어와 서빙 스택의 측정값에서 계산했습니다. 혼합 워크로드 결과는 환경별 차이를 포함합니다. 실제 적용 전 고객 트래픽 replay가 필요합니다.