AXCOBPRODUCT
COMPANY

AXCOB LABLLM SERVING WORKLOAD REVIEW

고객이 먼저 발견하기 전에,
서빙의 한계를 찾습니다.

24시간 요청 로그를 보내주세요. 실제 워크로드가 어디서 무너지는지 측정하고, 48시간 안에 라우팅과 입장 정책으로 돌려드립니다.

첫 3개 적격 워크로드 리뷰 무료 · 프롬프트 원문과 개인정보 불필요

MEASURED / H100CONCURRENCY 16
40.1sP99 TIME TO FIRST TOKEN

LLAMA 3.1 70B FP8 · VLLM 0.19.1
FLASHATTENTION V3 · FP8 KV CACHE

01 / MEASURED EVIDENCE

감이 아니라
측정으로 시작합니다.

H100 SXM5 한 장, Llama 3.1 70B FP8, vLLM 0.19.1. 다섯 번 반복하고 bootstrap 신뢰구간으로 확인했습니다.
A

THROUGHPUT / C4 → C16

83.05 → 83.20tokens per second

동시성은 4배가 됐지만 처리량은 0.18%만 늘었습니다. 부하를 더 넣어도 처리량을 사지 못했습니다.

B

P99 TTFT / C4 → C16

4.6s → 40.1s+772% tail latency

같은 조건에서 꼬리 지연은 772% 늘었습니다. 실제 경계는 평균이 아니라 꼬리에 있었습니다.

C

MIXED WORKLOAD

4.3x / 1.08xprovider-dependent result

같은 혼합 워크로드도 환경에 따라 결과가 달랐습니다. 보편값을 가정하지 않고 고객 환경에서 다시 재생해야 합니다.

CROSS-PROVIDER REPLICATION

처리량 plateau와 P99 TTFT 폭증은 두 번째 H100 SXM5 공급자에서도 같은 프로토콜로 재현됐습니다. 혼합 워크로드의 공정성 동작은 scheduler와 runtime에 민감해 고객별 replay가 필요했습니다.

재현 노트와 원본 데이터

REVIEW PIPELINE

로그에서 정책까지,
판단 경로를 남깁니다.

  1. 01INGEST

    비식별 요청 로그의 형식과 누락을 확인합니다.

  2. 02BUCKET

    입력 길이와 동시성별로 워크로드를 나눕니다.

  3. 03REPLAY

    측정 경계와 SLO 기준으로 트래픽을 재생합니다.

  4. 04POLICY

    라우팅·입장 판단을 검토 가능한 JSON으로 정리합니다.

평균 처리량은 대시보드가 보여줍니다.

P99는 고객이 느낍니다.

대부분의 팀은 첫 번째를 측정합니다. 두 번째를 제대로 측정하는 팀은 적고, 워크로드 구성이 바뀌는 순간까지 보는 팀은 더 적습니다.

02 / WHAT YOU SEND

파일 하나.
프롬프트는 필요 없습니다.

CSV 또는 JSONL 형식의 대표 트래픽 24시간분이면 시작할 수 있습니다. 개인정보와 프롬프트 내용은 받지 않습니다.
01request_id

해시 처리한 고유 식별자도 괜찮습니다.

02timestamp

ISO 8601 또는 Unix epoch. UTC를 권장합니다.

03input_tokens

토큰화된 입력 길이. 추정값도 가능합니다.

04output_tokens

토큰화된 출력 또는 완료 길이입니다.

05status

success, error, timeout 또는 같은 의미의 상태값입니다.

06latency_ms

종단 지연 시간. TTFT와 TPOT는 선택입니다.

아직 토큰 수를 기록하지 않는다면 prompt length나 비식별 샘플을 보내주세요. 추정 방법부터 함께 잡을 수 있습니다.

03 / WHAT YOU RECEIVE

세 가지 결과물.
48시간.

보고서로 끝나지 않고 플랫폼 팀이 바로 검토하고 재생할 수 있는 형태로 전달합니다.
01

Boundary match report

요청 버킷별로 측정됨, 안전 상향, 측정 범위 밖, 지원되지 않는 모델·하드웨어를 구분합니다.

MATCH / COVERAGE / SOURCE
02

Routing & admission policy

interactive, async, reject 분기와 입력 크기 임계값이 담긴 재생 가능한 JSON 정책을 제공합니다.

JSON / REVIEWER-LOCKED
03

SLO dry-run

chat, RAG, batch summarization 또는 자체 기준으로 로그를 재생하고 verdict와 SLO risk를 계산합니다.

REPLAY / VERDICT / RISK

04 / OPEN RESEARCH

결과를 만든 코드까지
직접 확인할 수 있습니다.

측정 방법론, 참조 corpus, 리뷰를 만드는 simulator를 GitHub에 공개했습니다. 고객에게 전달하는 결과도 같은 코드 경로에서 생성됩니다.

github.com/jacob-sunho-kim/llm-boundary-research TOOLKIT: MIT · RESEARCH ARTIFACTS: CC-BY-4.0
THE HONEST PART

모르는 범위는
모른다고 표시합니다.

참조 corpus는 아직 제한된 측정 환경에서 출발했습니다. GPU, 모델 계열, 양자화, 서빙 스택이 다르면 outside_measured_boundary로 명시합니다. 첫 3건을 무료로 진행하는 이유도 실제 워크로드에서 무엇을 더 측정해야 하는지 함께 배우기 위해서입니다.

START A REVIEW

24시간 로그로
경계를 확인하세요.

첫 3개 적격 리뷰 무료 · 48시간 이내 전달
리뷰 요청 메일 작성 프롬프트 원문 불필요 · 토큰 수 또는 추정값이면 충분합니다.

처리량 변화(+0.18%)와 TTFT 변화(+772%)는 명시한 하드웨어와 서빙 스택의 측정값에서 계산했습니다. 혼합 워크로드 결과는 환경별 차이를 포함합니다. 실제 적용 전 고객 트래픽 replay가 필요합니다.