코스 카탈로그
평가(Evals)와 프로덕션의 AI
AI를 테스트 스위트처럼 측정하고, 추적하고, 신뢰하세요.
- 중급
- 레슨 16개
- 프로젝트 3개
- 약 2.5시간
- EN · UZ · KO
2026년, 평가(eval) 없는 프롬프트 엔지니어링은 주니어 작업으로 여겨집니다 — 평가는 AI 개발이 엔지니어링이 되는 경계선입니다. 오류 분석과 골든 데이터셋에서 출발해, 평가자(evaluator)를 작성하는 법(정확 일치와 퍼지 일치, 루브릭 채점, 그리고 LLM-as-judge)과 CI에서 회귀(regression)를 막는 법을 배웁니다. 그다음 트레이스(trace)를 읽어 느리거나 비용이 큰 단계를 찾고, 스팬(span)과 메트릭을 이해하며, 관측 가능성(observability) 데이터로 실패를 디버깅합니다. 마지막으로 경제성에서 마무리합니다: 토큰 비용, 캐싱과 모델 라우팅, 지연(latency) 줄이기, 그리고 평가 대시보드가 초록색일 때만 배포하기.
커리큘럼
섹션 1
평가가 필요한 이유
눈대중을 멈추고 측정을 시작하세요.
- 느낌은 확장되지 않는다
- 오류 분석 먼저
- 골든 데이터셋
- 무엇을 측정할 것인가
섹션 2
평가기 작성하기
매칭, 루브릭, 심판, 그리고 게이트.
- 정확 매칭 & 퍼지 매칭
- 루브릭 채점
- 심판으로서의 LLM
- 회귀 게이트
섹션 3
관측성과 트레이싱
AI가 실제로 무엇을 했는지 들여다보기.
- 트레이스란?
- 트레이스 읽기
- 로그, 스팬, 메트릭
- 트레이스로 디버깅하기
섹션 4
비용, 지연 시간, 신뢰
빠르고, 저렴하고, 자신 있게 출시하세요.
- 토큰 경제학
- 캐싱과 모델 라우팅
- 지연 시간 줄이기
- 자신 있게 출시하기
학습 경로
레슨 하나를 체험하고 습관으로 이어가세요.
무료 체험 대상인 첫 가입 회원은 7일 무료 · 언제든 취소 가능
시작하기