Amazon Web Services 한국 블로그

Amazon CloudWatch Omni 소개: 생성형 AI 및 에이전트 워크로드를 위한 AI 기반 관찰성 솔루션

오늘 Amazon CloudWatch는 애플리케이션 및 AI 워크로드를 위한 통합 옵저버빌리티 경험인 CloudWatch Omni를 소개합니다. CloudWatch Omni는 애플리케이션 중심으로 AI를 활용하고 개방형 표준을 기반으로 하며 콘솔 외부에서 제공됩니다. CloudWatch Omni는 AI 에이전트를 위해 특별히 구축된 관찰성, 평가 및 실험 솔루션입니다. 팀이 어떤 모델 제공업체, 프레임워크 또는 런타임에서든 AI 에이전트를 설계, 평가, 운영할 수 있도록 지원하며, 평가 중심 워크플로, 이미 사용 중인 도구 지원, 작업 환경에서 바로 사용할 수 있는 관찰성을 제공합니다. 관찰성은 IDE에서 직접 사용하거나 AWS Management Console과 별도로 제공되는 독립형 웹 환경을 통해 사용할 수 있습니다.

에이전트 AI 시스템을 배포하는 조직은 기존 모니터링 방식으로는 해결할 수 없는 관찰성 문제에 직면해 있습니다. 에이전트 동작은 비결정적이므로 표준 지표에서 오류가 나타나지 않더라도 프롬프트를 변경하면 응답 품질이 저하될 수 있습니다. 팀은 여러 시스템의 로그를 수동으로 검토하는 데 몇 시간을 소비하지만 변경된 내용이나 이유를 정확히 찾아내지 못합니다. 기존 도구는 팀이 사일로화된 생성형 AI 모니터링과 코딩 환경 및 브라우저 기반 대시보드 간에 지속적으로 컨텍스트를 전환해야 하는 분산된 솔루션 중 하나를 선택하게 합니다.

CloudWatch Omni는 모든 추적 데이터를 수집하고 정확성, 일관성, 검색 품질, 도구 선택 등을 평가할 수 있는 기본 제공 평가기를 포함합니다. 플레이그라운드에서 프롬프트 버전을 나란히 비교하고, 프로덕션 트래픽에서 테스트 데이터세트를 구축하고, 다양한 구성에 걸쳐 실험을 실행하고, 회귀를 자동으로 감지할 수 있습니다.

개발과 운영을 위한 두 가지 환경
CloudWatch Omni는 두 가지 상호 보완적인 환경을 통해 관찰성을 제공합니다. 개발자는 VS Code와 Kiro(현재 지원되는 IDE)에서 네이티브 확장 기능을 사용할 수 있으며, 에이전트를 실행하는 동안 트레이스가 표시되고 클릭 한 번으로 플레이그라운드와 평가기에 액세스할 수 있습니다. 운영자는 AWS Management Console과 별개로 플릿을 모니터링할 수 있는 독립형 웹 환경을 이용할 수 있으며, AWS Console 없이도 SSO를 통해 액세스할 수 있습니다. 둘 다 동일한 데이터를 공유합니다. 즉, 운영자가 조사하는 트레이스를 그대로 개발자가 디버깅합니다.

Cloud Login 기능은 로컬 IDE 환경을 AWS 계정에 연결하여 영구 스토리지용 텔레메트리 데이터를 Amazon CloudWatch로 전송하고, 팀과 트레이스를 공유하고, 프로덕션 대시보드에 액세스할 수 있도록 합니다. 이 연결은 선택 사항입니다. 개발 중에는 CloudWatch Omni를 완전히 로컬로 사용하고, 프로덕션 환경에서 에이전트를 모니터링할 준비가 되면 클라우드에 연결할 수 있습니다.

시작하기
CloudWatch Omni는 두 가지 방법으로 시작할 수 있습니다. 하나는 IDE 확장 기능(VS Code 및 Kiro용)을 사용하는 것이고, IDE 확장 기능을 설치하지 않고도 CloudWatch로 원격 측정 데이터를 전송할 수 있는 클라우드 환경을 통해 직접 시작하는 방법입니다. 이 가이드에서는 확장 기능을 설치하고, 에이전트를 만들어 실행하고, IDE에서 추적 및 평가 도구를 살펴봅니다.

VS Code 마켓플레이스에서 CloudWatch Omni 확장 기능을 설치하면 활동 표시줄에 CloudWatch Omni 아이콘이 나타납니다. 시작 화면에서 샘플 프로젝트 시작하기를 선택하여 샘플 추적 데이터가 포함된 사전 구성된 에이전트를 로드하거나, 명령 팔레트 바로 가기 Command+Shift+P(macOS의 경우) 또는 Ctrl+Shift+P(Windows/Linux의 경우)를 누르고 Omni: 새 프로젝트 생성을 선택합니다.

CloudWatch Omni 시작 화면 및 VS Code에서 새 프로젝트 생성
그림 1. CloudWatch Omni 시작 화면 및 VS Code에서 새 프로젝트 생성

샘플 프로젝트는 에이전트 구현 및 샘플 데이터세트와 함께 제공됩니다. 시작 과정 중 하나는 OpenTelemetry 계측을 추가하는 것인데, CloudWatch Omni가 각 단계를 안내합니다. 에이전트를 완전히 새로 만들 수도 있습니다. CloudWatch Omni는 에이전트의 용도를 정의하고, 모델 제공업체를 선택하고, 도구를 구성하는 대화형 채팅을 통해 프로세스를 안내합니다. 모든 데이터는 기본적으로 로컬로 저장됩니다. 필요에 따라 AWS에 연결하여 Amazon CloudWatch로 데이터를 전송할 수 있습니다.

구성을 확인한 후 로컬 개발 서버를 시작하고 에이전트에게 질문을 보냈습니다. 다음 단계부터 일반적인 챗봇 인터페이스와 다릅니다. 트레이스 보기를 선택하면 에이전트가 요청을 어떻게 처리했는지 정확히 알 수 있습니다.

CloudWatch Omni는 AI 코드 어시스턴트가 개발 환경을 구성하도록 안내합니다.
그림 2. CloudWatch Omni는 AI 코드 어시스턴트가 테스트용으로 로컬 개발 환경을 구성하도록 안내합니다.

CloudWatch Omni는 Kiro, Claude Code, Codex 등의 AI 코드 어시스턴트와 통합되어 설정 프로세스를 간소화합니다. 이 어시스턴트는 사용자를 대신하여 개발 서버를 구성하고, 종속 구성 요소를 설치하고, 계측을 설정할 수 있으므로, 고객이 수동 구성 없이 몇 분 만에 첫 번째 추적된 에이전트 세션을 설치하고 실행할 수 있습니다.

에이전트와의 상호 작용 및 트레이스 보기
그림 3. 에이전트와의 상호 작용 및 트레이스 보기

트레이스는 AI 에이전트 동작을 이해하는 데 필수적입니다. 에이전트는 기존의 요청-응답 시스템과 달리 직접 호출할 때마다 도구 선택, 프롬프트 작성, 하위 통화 연결 등 여러 결정을 내립니다. 트레이스에 대한 완전한 가시성이 없으면 에이전트가 왜 오답을 냈는지 또는 예상치 못한 경로를 선택했는지 정확히 진단할 수 없습니다. CloudWatch Omni는 모든 단계를 구조화된 타임라인으로 기록하므로, 동작이 정확히 어느 지점에서 달라졌는지 파악할 수 있습니다.

트레이스 탐색기는 에이전트가 수행한 모든 단계(LLM 직접 호출, 도구 간접 호출, 추론 단계)를 구조적이고 계층화된 타임라인으로 자세히 보여줍니다. 따라서 모든 범위를 자세히 살펴보면서 입력, 출력, 토큰 사용량 및 지연 시간을 검사할 수 있습니다.

에이전트 실행 타임라인을 보여주는 트레이스 탐색기
그림 4. 에이전트의 실행 타임라인을 보여주는 트레이스 탐색기

트레이스 탐색기는 두 개의 트레이스를 나란히 배치하여 서로 다른 프롬프트 또는 구성이 동작에 미치는 영향을 확인하는 비교 모드도 지원합니다. 비교 모드는 회귀를 디버깅할 때 특히 유용합니다. 또한 AI 에이전트는 어시스턴트에게 문의하기를 사용하여 트레이스를 분석함으로써 패턴과 이상 징후를 찾아내고 “에이전트가 이 도구를 두 번 호출한 이유는 무엇입니까?”와 같은 질문에 답합니다.

두 트레이스를 나란히 비교
그림 5. 두 트레이스를 나란히 비교

평가는 관찰성을 생성형 AI의 품질을 실제로 개선할 수 있는 유용한 인사이트로 전환해 줍니다. 지연 시간 및 오류율과 같은 기존 지표로는 에이전트의 응답이 유용했는지, 일관성이 있었는지, 사실적으로 정확했는지를 알 수 없습니다. 평가기는 품질 차원을 기준으로 각 응답에 점수를 매기므로, 사용자가 실제로 경험하는 성능을 측정하고 표준 모니터링에서 완전히 놓치는 회귀 현상을 파악할 수 있습니다.

CloudWatch Omni에는 일관성, 유용성, 충실도, 라우팅 정확성과 같은 지표에 대한 17개의 내장 평가기가 포함되어 있습니다. 트레이스 탐색기에서 트레이스를 선택하고 평가기를 선택한 다음 평가를 실행했습니다. 사용자 지정 평가 프레임워크를 구축하지 않고도 예시별 점수와 집계 지표를 얻을 수 있었습니다.

트레이스에 대한 평가 실행
그림 6. 트레이스에 대한 평가 실행

그런 다음 플레이그라운드를 사용하여 여러 시스템 프롬프트를 나란히 놓고 테스트하면서 여러 모델과 프롬프트 구성을 실시간으로 비교하여 변경 사항을 적용하기 전에 각 변형이 출력 품질에 미치는 영향을 확인했습니다. 실험 보기에서는 두 에이전트 변형에 대해 동일한 데이터세트를 실행하고, 평가 점수, 지연 시간, 토큰 사용량을 나란히 비교하여 가장 성능이 좋은 구성을 선택할 수 있었습니다.

그림 7. Omni Experiments 콘솔에서 여러 에이전트 변형에 걸친 평가 비교

프롬프트 관리를 사용하면 장기적으로 프롬프트 구성을 버전 관리하고 추적할 수 있으므로, 새 버전의 성능이 낮을 때 쉽게 롤백할 수 있습니다.

또한 CloudWatch Omni는 전체 대화 기록을 검토하고 에이전트가 멀티턴 상호 작용을 처리하는 방식을 파악할 수 있는 세션 탐색기를 제공합니다. 또한 에이전트 시스템의 아키텍처를 시각화하여 하위 에이전트, 도구, 인터커넥트 등을 보여주는 에이전트 토폴로지 보기도 제공합니다. 원하는 노드를 자세히 분석하여 성능을 검사하고 병목 지점을 식별할 수 있습니다.

또한 CloudWatch Omni는 IDE 없이 모든 브라우저에서 액세스할 수 있는 전용 웹 환경을 제공합니다. 팀은 애플리케이션 모니터링, 분석, 에이전트 관찰성, AI 기반 조사를 비롯한 모든 기능에 공동으로 액세스할 수 있습니다.

애플리케이션 모니터링, 분석 및 에이전트 관찰성 기능을 제공하는 CloudWatch Omni 웹 경험
그림 8. 애플리케이션 모니터링, 분석 및 에이전트 관찰성 기능을 제공하는 CloudWatch Omni 웹 경험

구조화된 실험을 위해 트레이스를 골든 데이터세트로 큐레이팅했습니다. Experiment 함수는 데이터세트에 대해 에이전트를 실행하고 결과에 자동으로 점수를 매겨 프롬프트나 에이전트 로직이 변경될 때마다 회귀 테스트를 위한 벤치마크를 생성합니다.

지원되는 프레임워크로 구축된 에이전트가 이미 있는 경우, CloudWatch Omni는 계측을 추가할 수 있는 두 가지 경로를 제공합니다. 하나는 프레임워크를 탐지하고 추적을 자동으로 구성하는 Kiro를 사용한 자동 계측이고, 다른 하나는 바로 사용할 수 있는 Python 및 TypeScript용 코드 스니펫을 사용한 수동 계측입니다. 자세한 계측 가이드는 CloudWatch Omni 설명서를 참조하세요.

지원되는 프레임워크 및 개방형 표준
위의 설명에서는 샘플 프로젝트를 사용하지만 CloudWatch Omni는 Python과 TypeScript에서 LangChain, LangGraph, CrewAI, OpenAI SDK, Strands, Vercel AI SDK 등 팀에서 이미 사용하고 있는 에이전트 프레임워크와 함께 작동합니다. 또한 Amazon Bedrock AgentCore로 구축한 에이전트에 대한 기본 관찰성 기능을 제공하고 AgentCore의 평가 기능을 사용하여 Omni 워크플로 내에서 직접 에이전트 품질을 평가합니다.

계측기는 에이전트가 Lambda, ECS, EKS 또는 기타 클라우드에서 실행되는지 여부에 관계없이 개방형 표준(OpenInference 및 ADOT)을 사용합니다. 평가를 위해 Omni는 Braintrust, DeepEval, Ragas를 비롯한 서드 파티 평가기와 함께 내장 데이터세트, 플레이그라운드, 배치 실험과 함께 통합됩니다. 리플랫포밍할 필요가 없습니다.

CloudWatch Omni는 단일 환경에서 에이전트 관찰성과 애플리케이션 관찰성을 통합합니다. 애플리케이션 관찰성 경험에 대해서는 함께 게시된 Amazon CloudWatch Omni 소개: 애플리케이션을 위한 협업 AI 기반 관찰성을 읽어보세요.

요금 및 가용성
이제 Amazon CloudWatch Omni가 정식 출시되었습니다. IDE 확장 기능은 무료로 사용할 수 있습니다. 시작하는 데 AWS 계정이 필요하지 않습니다. Amazon Bedrock 모델을 위한 AWS 자격 증명이나 OpenAI 또는 Anthropic과 같은 다른 제공업체를 위한 API 키만 있으면 됩니다. VS Code 마켓플레이스에서 확장 기능을 설치하여 지금 바로 시작하세요.

모든 기능을 살펴보고 빠르게 시작하려면 AWS Builder Center의 CloudWatch를 방문하세요.

API를 호출하고, 문서를 검색하고, 리전별 가용성을 확인하고, 이 기능에 대한 문제 해결을 확인하려면 선호하는 AI 도구를 사용하여 AWS MCP Server 및 플러그인을 활용하세요. AWS re:Post 또는 평소 연락하는 AWS Support 담당자를 통해 피드백을 공유해 주세요.

즐겁게 빌드해 보세요!

– Daniel Abib