본문으로 건너뛰기

AI 어시스턴트 FAQ

AWSops AI 어시스턴트에 대한 질문과 답변입니다.

어떤 질문을 할 수 있나요?

AI 어시스턴트는 9개 섹션 도메인(+로컬 전문 섹션)에 걸쳐 AWS/Kubernetes 운영 질문에 답합니다. 어떤 도메인이 필요한지는 자동으로 판별되며(아래 "라우팅" 참고), 자연어로 물어보면 됩니다.

도메인예시 질문
Network"EC2 A에서 B로 연결이 안 돼요", "VPC 피어링 라우팅 확인해줘", "Security Group 규칙 분석해줘"
Container"EKS Pod가 Pending이에요", "ECS 서비스 배포 실패 원인은?"
Data"RDS 연결이 느려요", "DynamoDB throttling 원인은?", "ElastiCache 메모리 부족"
Security"이 IAM 정책 권한 분석해줘", "S3 버킷 접근 권한 시뮬레이션", "cross-account 역할 설정"
Monitoring"CloudWatch 경보 설정 방법", "CloudTrail에서 특정 이벤트 찾기", "EC2 CPU 추세 분석"
Cost"이번 달 비용 분석", "비용 급증 원인은?", "비용 최적화 추천"
IaC"이 Terraform 검토해줘", "CloudFormation 스택 생성 실패 원인은?"
Observability"서비스 p99 지연시간 보여줘 (Prometheus)", "ClickHouse 트레이스에서 느린 호출 찾아줘"
Ops위 분류에 딱 맞지 않는 일반 AWS 운영 질문

데이터소스(외부 관측성)를 연결해 두었다면, 자연어를 그대로 PromQL/LogQL 등으로 변환해 질의할 수도 있습니다 — 자세한 내용은 아래 "외부 관측성"과 데이터소스 개발 FAQ를 참고하세요.

질문이 어떻게 알맞은 도메인으로 라우팅되나요?

AI 어시스턴트는 하이브리드 라우팅(ADR-038, LIVE)을 사용합니다. 더 이상 모든 질문을 대형 모델에 던지는 고정 라우트 레지스트리가 아닙니다.

3단계 파이프라인

  1. 정규식 fast-path — 명확한 신호("EKS pod", "IAM policy", "cost spike" 등)는 패턴 매칭만으로 즉시 도메인을 정하고, 모델 호출 없이 라우팅합니다(지연·비용 0).
  2. Haiku 4.5 분류기 — fast-path로 확정되지 않으면, 가볍고 빠른 Haiku 모델이 질문을 분류해 적절한 섹션으로 보냅니다.
  3. 프롬프트 캐싱 — 시스템 프롬프트/도구 정의를 캐싱해 반복 호출의 지연과 토큰 비용을 줄입니다(캐시 적중률 약 59%).

명시적으로 영역을 고르고 싶다면 입력창에 슬래시(/)를 입력하세요. 아래 "슬래시 영역 지정" 항목을 참고하세요.

AWS 데이터는 어떻게 실시간으로 가져오나요?

실시간 AWS 조회는 AgentCore MCP(Model Context Protocol) Lambda 도구를 통해 이루어집니다. 어시스턴트가 질문에 답하는 데 필요한 데이터를 도구로 직접 조회한 뒤 분석합니다.

  • 약 160개의 읽기 전용 도구9개 섹션 게이트웨이(Network / Container / Data / Security / Monitoring / Cost / IaC / Ops / External-Obs — ADR-004 개정)에 나뉘어 있습니다. 도구 수는 대략적이며 계속 진화 중입니다.
  • 외부 관측성 커넥터(Prometheus·ClickHouse)는 external-obs 게이트웨이로 승격되어 아홉 번째로 라우팅됩니다(ADR-004 개정 2026-06-24, 9 프로비저닝/9 라우트). 벤더 호스팅 통합 등 나머지 외부 연동은 별도의 Integrations 축(ADR-007/017)입니다.
  • Steampipe는 플래그로 게이트된 인벤토리 동기화(steampipe_enabled, 기본 OFF) 용도로만 존재합니다. 실시간 질의 엔진이 아니며, 상시 떠 있는 로컬 서비스도 아닙니다.
기술 상세

게이트웨이↔Lambda 관계, MCP 프로토콜 내부, 새 도구 추가 방법은 AgentCore & Memory FAQ를 참고하세요.

슬래시(/)로 영역을 직접 지정할 수 있나요?

네. 자동 라우팅이 기본이지만, 입력창에서 슬래시(/)를 입력하면 섹션 도메인을 직접 선택할 수 있습니다(/network, /cost, /security 등). 명시적으로 고르면 라우팅 판별을 건너뛰고 해당 섹션으로 바로 보냅니다.

자동 도메인 배지

직접 고르지 않아도, 응답에는 어떤 도메인으로 라우팅되었는지를 보여주는 도메인 배지가 표시됩니다. 의도와 다른 영역으로 갔다면 슬래시로 다시 지정하거나 질문을 더 구체적으로 바꿔 보세요.

대화 기록은 저장되나요?

네. 대화는 Aurora(PostgreSQL)에 스레드 단위로 영속 저장됩니다. 파일 기반 사용자별 메모리(data/memory/)는 더 이상 사용하지 않습니다.

  • Claude 앱 스타일 사이드바 — 왼쪽 사이드바에서 과거 스레드를 탐색하고, 새 대화를 시작하거나 이전 대화를 이어갈 수 있습니다.
  • 전용 페이지 + 드로어가 하나의 기록 공유 — 전체 페이지(/assistant)와 어디서나 띄울 수 있는 리사이즈 가능한 챗 드로어가 동일한 스레드 기록을 공유합니다. 드로어에서 시작한 대화를 전체 페이지에서 그대로 이어가도 됩니다.
  • 딥링크?thread=<id> 쿼리로 특정 스레드를 바로 열 수 있어, 동료에게 대화 링크를 공유하기 좋습니다.
  • 응답은 마크다운으로 렌더링되며, 스트리밍 중에도 텍스트가 실시간으로 표시됩니다.
어시스턴트가 리소스를 바꾸기도 하나요?

아니요. AWSops는 읽기 전용 운영 대시보드 + AI 진단입니다. 어시스턴트는 AWS 리소스를 생성·수정·삭제·재시작하지 않습니다.

  • AWS 리소스 변경과 자율 실행은 영구 동결(do-not-enable)입니다 — 2026-06-11 고위험 ADR 번복 합의에 따른 정책입니다.
  • 어시스턴트는 진단·근본원인분석(RCA)·권장 사항만 제시합니다. 실제 변경은 사용자가 AWS 콘솔/IaC에서 직접 수행합니다.
  • 단, 외부 데이터 측면에서는 거버넌스 하에서 외부 관측성을 읽고, 외부 기록/티켓/메시지를 쓸 수 있습니다(ADR-041). 이는 SSRF 가드·Secrets Manager·DLP/redaction·대상 allowlist·human-gate·flag-OFF 통제를 거치며, AWS 리소스 변경이 아니라 외부 시스템의 데이터 레코드입니다.

"어시스턴트가 이 인스턴스를 재시작해줘" 같은 변경 요청은 수행되지 않습니다. 대신 "왜 이 인스턴스가 불안정한지 진단해줘"처럼 물어보세요.

AI 종합 진단(AI Diagnosis)이 뭔가요?

AI 종합 진단은 워커 티어가 비동기로 수행하는 읽기 전용 진단 리포트입니다. 무거운 다단계 수집·분석 작업이므로 채팅처럼 인라인으로 처리하지 않고 백그라운드 작업으로 큐에 넣어 실행합니다.

두 가지 깊이(tier)

Tier섹션 수기본 모델
Light8+1개 섹션(총 9 렌더 — 현재 Mid와 동일 카탈로그·토큰 예산)Sonnet
Mid8+1개 섹션(총 9 렌더)Sonnet
Deep15+1개 섹션(base 8 + deep 전용 7 + 의도 대비 실제, 총 16 렌더)Sonnet 기본, Opus 선택 가능(deep 전용, cost-gate 적용)

기능

  • 자동 제목 + 태그(자동 제안 + 수동 추가) + 제목 수정.
  • 소프트 삭제 — 삭제해도 기록은 보존되며, 소유자 또는 admin만 삭제할 수 있습니다.
  • 내보내기 — DOCX / PDF로 생성해 S3에 저장하고, 앱에서 프록시 다운로드합니다(한국어 포함 CJK 폰트 임베드).
  • 생성 일시는 KST로 표기됩니다.

진단은 기존 수집 도구를 재사용하며, 어디까지나 읽기 전용입니다 — 어떤 AWS 리소스도 변경하지 않습니다.

코드를 실행할 수 있나요?

네. Code Interpreter를 통해 Python 코드를 실행할 수 있습니다. 데이터 분석·시각화 질문에 자동으로 활용됩니다.

지원

  • Python 3.x 실행 환경, 주요 라이브러리(pandas, numpy, matplotlib 등)
  • 차트/그래프 생성, 임시 디렉터리 내 파일 입출력

제약

  • 샌드박스 환경(네트워크 접근 제한) · 실행 시간 제한
  • AWS API를 직접 호출하지 않습니다 — 어시스턴트가 MCP 도구로 데이터를 먼저 조회한 뒤, 그 데이터를 코드로 분석합니다.

예시 질문

  • "EC2 인스턴스 타입별 비용을 파이 차트로 보여줘"
  • "최근 30일 CloudTrail 이벤트를 시간대별로 분석해줘"
  • "Lambda 함수 메모리 사용량 통계를 계산해줘"
AI가 잘못된 답을 하면 어떻게 하나요?

AI 어시스턴트는 Amazon Bedrock(Claude Sonnet / Opus / Haiku)을 기반으로 합니다.

데이터 정확성

  • AWS 리소스 데이터는 AgentCore MCP 도구로 실시간 조회됩니다.
  • 데이터 자체는 정확하더라도, AI의 해석이 틀릴 수 있습니다.

대처 방법

  1. 추가 질문으로 확인 — "그 정보의 출처가 뭐야?", "더 자세히 설명해줘"
  2. 직접 확인 — 대시보드의 해당 페이지 또는 AWS 콘솔에서 검증
  3. 피드백 제공 — "틀렸어", "다시 확인해줘"라고 말하면 재분석. 구체적 오류를 지적할수록 정확해집니다.

AI 한계

  • 현재 진행 중인 장애(실시간 이벤트)는 즉시 인지하지 못할 수 있습니다.
  • 최신 AWS 기능은 학습 데이터에 없을 수 있습니다.
  • 계정별 특수 설정이나 SCP 제한을 고려하지 못할 수 있습니다.
응답이 느릴 때는?

AI 응답이 지연되는 일반적 원인과 해결책입니다.

1. AgentCore Runtime 콜드 스타트 — 첫 요청은 컨테이너 기동에 시간이 걸리고(수십 초), 이후 요청은 Warm 상태로 빠릅니다.

2. 복잡한 질문 — 여러 도메인이 얽힌 질문은 오래 걸립니다. "네트워크 분석하고 비용도 봐줘" → 두 질문으로 분리하세요.

3. 대량 데이터 조회 — CloudTrail 이벤트, 대규모 리소스 목록 등은 기간/필터를 지정하세요(예: "최근 1시간", "production 태그만").

4. 네트워크 경로 — CloudFront → 내부 ALB → Fargate → AgentCore. CloudFront Origin 타임아웃 설정(60초 권장)을 확인하세요.

스트리밍 응답

응답은 스트리밍되어 전체를 기다리지 않고 실시간으로 표시됩니다.

기술 상세

TTFT(Time To First Token) 구성 요소와 개선 방법은 아키텍처 Deep Dive를 참고하세요.