핵심 기능
- 에이전트 세션과 멀티턴 대화, 또는 애플리케이션 코드의 개별 함수 Call과 출력에 대한 가시성.
- 엄선된 테스트 케이스를 기준으로 성능을 측정하는 체계적인 평가.
- 무엇이 변경되었는지 파악할 수 있도록 프롬프트, 모델, 데이터의 버전 추적.
- 다양한 프롬프트와 모델을 비교하는 실험.
- 사람의 판단과 어노테이션을 수집하기 위한 피드백 수집.
- LLM의 안전성과 품질을 위해 프로덕션 환경에서 가드레일과 Scorer를 사용하는 모니터링.
워크플로 선택하기
- 자동 에이전트 트레이싱
- 애플리케이션의 임의의 LLM Call 및 함수를 계측하여 입력, 출력, 코드를 트레이스
에이전트 트레이싱
invoke_agent 및 execute_tool처럼 GenAI 에이전트 규약을 따르는 span은 Agents 뷰에서 대화, 턴, 도구 Call로 렌더링됩니다. 직접 만든 에이전트에서 이러한 span을 내보내는 방법을 알아보려면 맞춤형 에이전트 퀵스타트를 확인하세요.
에이전트를 개발 중이라면 기본 제공 인테그레이션을 선택할 수 있는 에이전트 인테그레이션 퀵스타트부터 시작하거나, 직접 만든 에이전트를 수동으로 계측하려면 맞춤형 에이전트 퀵스타트를 따라 하세요. Weave SDK가 에이전트를 어떻게 모델링하는지 알아보려면 에이전트를 트레이스하는 방법을 확인하세요.
Claude Code 또는 OpenAI Agent SDK와 같이 지원되는 타사 에이전트 하니스를 사용 중이라면, Weave가 별도의 코드 추가 없이 자동으로 계측합니다. 지원되는 모든 프레임워크는 Integrations에서 확인하세요.
함수 계측 및 트레이싱
- 데이터가 LLM 애플리케이션 전반에서 어떻게 흐르는지 엔드 투 엔드로 추적하세요.
- LLM 피드백을 생성하는 데 사용된 원본 문서를 확인하세요.
- 특정 프롬프트와 답변이 생성되는 방식을 자세히 살펴보세요.
에이전트 트레이싱과 애플리케이션 계측을 언제 사용해야 하는지
- 에이전트를 구축하거나 실행하는 경우에는 에이전트 트레이싱을 사용하세요. 지원되는 에이전트 하니스나 에이전트 SDK를 사용하거나, 직접 계측할 수 있는 맞춤형 에이전트를 구축한 경우에 적합합니다.
- 애플리케이션 코드를 트레이싱하는 경우에는 애플리케이션 계측을 사용하세요. RAG 파이프라인, 요약 엔드포인트, 맞춤형 비즈니스 로직처럼 대화보다는 개별 Call을 중심으로 구성된 애플리케이션에 적합합니다.
weave.op Call은 Traces 페이지에 표시됩니다. 같은 Weave 프로젝트에서 두 방식을 모두 사용할 수 있지만, 각각 별도의 트레이스를 생성합니다.
어디서 시작해야 할지 잘 모르겠고 시스템에 에이전트가 포함되어 있다면 에이전트 인테그레이션 퀵스타트로 에이전트 트레이싱부터 시작하세요. 그렇지 않다면 Op 트레이싱 퀵스타트로 시작하세요.
평가
- 어떤 모델 및 프롬프트 버전이 어떤 성능으로 이어졌는지 추적할 수 있습니다.
- 하나 이상의 scoring function을 사용해 응답을 평가하는 메트릭을 정의합니다.
- 여러 메트릭에 걸쳐 두 개 이상의 서로 다른 평가를 비교합니다. 특정 샘플의 성능 차이도 대조할 수 있습니다.
모든 요소를 버전 관리하세요
프롬프트와 모델 실험하기
피드백 수집
프로덕션 모니터링
Weave 시작하기
- https://wandb.ai/site에서 W&B 계정을 만들고, https://wandb.ai/authorize에서 API 키를 발급받습니다.
- Weave를 설치합니다:
- 스크립트에서 Weave를 임포트하고 프로젝트를 초기화합니다.
<your-team>은 담당 W&B 팀 이름으로,<your-project>는 W&B 프로젝트 이름으로 바꾸세요.