본문으로 건너뛰기

코스 카탈로그

평가(Evals)와 프로덕션의 AI

AI를 테스트 스위트처럼 측정하고, 추적하고, 신뢰하세요.

2026년, 평가(eval) 없는 프롬프트 엔지니어링은 주니어 작업으로 여겨집니다 — 평가는 AI 개발이 엔지니어링이 되는 경계선입니다. 오류 분석과 골든 데이터셋에서 출발해, 평가자(evaluator)를 작성하는 법(정확 일치와 퍼지 일치, 루브릭 채점, 그리고 LLM-as-judge)과 CI에서 회귀(regression)를 막는 법을 배웁니다. 그다음 트레이스(trace)를 읽어 느리거나 비용이 큰 단계를 찾고, 스팬(span)과 메트릭을 이해하며, 관측 가능성(observability) 데이터로 실패를 디버깅합니다. 마지막으로 경제성에서 마무리합니다: 토큰 비용, 캐싱과 모델 라우팅, 지연(latency) 줄이기, 그리고 평가 대시보드가 초록색일 때만 배포하기.

커리큘럼

  1. 섹션 1

    평가가 필요한 이유

    눈대중을 멈추고 측정을 시작하세요.

    1. 느낌은 확장되지 않는다
    2. 오류 분석 먼저
    3. 골든 데이터셋
    4. 무엇을 측정할 것인가
  2. 섹션 2

    평가기 작성하기

    매칭, 루브릭, 심판, 그리고 게이트.

    1. 정확 매칭 & 퍼지 매칭
    2. 루브릭 채점
    3. 심판으로서의 LLM
    4. 회귀 게이트
  3. 섹션 3

    관측성과 트레이싱

    AI가 실제로 무엇을 했는지 들여다보기.

    1. 트레이스란?
    2. 트레이스 읽기
    3. 로그, 스팬, 메트릭
    4. 트레이스로 디버깅하기
  4. 섹션 4

    비용, 지연 시간, 신뢰

    빠르고, 저렴하고, 자신 있게 출시하세요.

    1. 토큰 경제학
    2. 캐싱과 모델 라우팅
    3. 지연 시간 줄이기
    4. 자신 있게 출시하기

학습 경로

레슨 하나를 체험하고 습관으로 이어가세요.

무료 체험 대상인 첫 가입 회원은 7일 무료 · 언제든 취소 가능

시작하기

코스 목록으로 돌아가기