AI 에이전트는 단순히 질문에 답하는 도구에서 목표를 해석하고, 계획을 세우고, 데이터에 접근하며, 소프트웨어 도구를 사용해 실제 작업을 수행하는 시스템으로 발전하고 있다. 에이전트는 문서를 검토하거나 고객 기록을 수정하고, 메시지를 전송하고, 코드를 변경하며, 금융 업무 흐름에 참여할 수도 있다.
이러한 능력은 기업에 큰 운영 가치를 제공하지만 오류, 조작, 무단 접근이 일으킬 수 있는 피해도 확대한다. 따라서 AI 에이전트 보안은 모델이 생성하는 답변만 검사하는 것으로 충분하지 않다. 에이전트의 신원, 권한, 도구, 메모리, 데이터 연결, 실행 중 행동까지 함께 보호해야 한다.
보안의 목적은 에이전트의 자율성을 완전히 제거하는 것이 아니다. 조직이 확인하고 통제할 수 있는 명확한 경계 안에서 에이전트가 효율적으로 행동하도록 만드는 것이 핵심이다.
AI 에이전트에 추가적인 보안 통제가 필요한 이유
기존 애플리케이션은 일반적으로 코드에 미리 정의된 경로를 따라 작동한다. 반면 AI 에이전트는 상황을 해석하고 사용할 단계와 도구를 동적으로 선택한다. 비슷한 요청에도 서로 다른 계획과 결과, 행동이 나타날 수 있다.
인증, 권한 부여, 취약점 검사, 네트워크 보호, 안전한 소프트웨어 개발과 같은 기존 애플리케이션 보안은 여전히 중요하다. 그러나 에이전트형 시스템에서는 자연어 지시, 검색된 컨텍스트, 장기 메모리, 도구 선택, 다단계 실행 과정도 보호해야 한다.
연결되는 서비스가 늘어날수록 공격 표면 역시 커진다. 이메일, 클라우드 저장소, 소스 코드, 고객 데이터베이스, 금융 시스템에 접근하는 에이전트는 각각의 권한을 예상하지 못한 방식으로 결합할 수 있다. 따라서 에이전트가 특정 시스템에 접속할 수 있는지만 확인해서는 안 된다. 무엇을 하려는지, 어떤 데이터를 사용하는지, 그 행동이 현재 목적과 일치하는지도 평가해야 한다.
주요 AI 에이전트 보안 위험
프롬프트 인젝션은 대표적인 위협이다. 공격자는 사용자 입력뿐 아니라 웹페이지, 이메일, 공유 문서, 지원 티켓, 데이터베이스 레코드에 악의적인 지시를 숨길 수 있다. 에이전트가 해당 콘텐츠를 읽으면 신뢰할 수 없는 데이터를 승인된 명령으로 잘못 해석할 가능성이 있다.
공격에 성공하면 에이전트가 기존 규칙을 무시하거나 보호된 정보를 노출하고, 허용되지 않은 도구를 사용할 수 있다. 텍스트만 생성하는 시스템보다 실제 환경에서 행동할 수 있는 에이전트에서 피해가 훨씬 커질 수 있는 이유다.
과도한 권한도 중대한 문제다. 편의성을 위해 에이전트에 업무상 필요한 범위를 넘어서는 접근 권한을 제공하면, 한 번의 잘못된 판단이나 보안 침해가 심각한 사고로 이어질 수 있다. 침해된 에이전트가 기밀 기록을 검색하고, 운영 데이터를 변경하며, 외부 메시지를 보내거나 거래를 실행할 수 있는 상태를 피해야 한다.
도구 오용은 추론 오류를 현실의 피해로 바꾼다. 에이전트는 잘못된 도구를 선택하거나 안전하지 않은 매개변수를 전달하고, 부적절한 시점에 작업을 실행할 수 있다. 잘못된 답변은 수정할 수 있지만 데이터 삭제, 권한 변경, 금융 거래는 쉽게 되돌리지 못할 수 있다.
데이터 유출은 에이전트가 사용자의 권한을 넘어선 정보를 검색하거나, 출력에 비밀을 포함하거나, 민감한 컨텍스트를 외부 서비스로 보내는 경우 발생한다. 안전하지 않은 로그에 개인정보나 인증 정보를 기록하는 것도 유출 경로가 될 수 있다. 여러 시스템을 연결하는 에이전트에서는 한 환경의 정보가 의도하지 않게 다른 환경으로 전달될 위험이 특히 크다.
메모리 오염과 공급망 위험
메모리 및 컨텍스트 오염은 공격자가 에이전트의 향후 판단에 사용될 정보원에 거짓 또는 악성 데이터를 삽입하는 공격이다. 장기 메모리, 벡터 데이터베이스, 공유 문서, 고객 기록, 사내 지식 기반 등이 대상이 될 수 있다.
오염된 정보는 한 번의 대화가 끝난 뒤에도 남을 수 있다. 에이전트가 이후 작업에서 이를 다시 검색하고 신뢰할 수 있는 사실로 취급하기 때문이다. 여러 에이전트가 협력하는 환경에서는 조작된 컨텍스트가 다른 에이전트로 이동해 더 높은 권한을 가진 업무 흐름에 영향을 줄 수도 있다.
AI 공급망 역시 중요한 공격 영역이다. 에이전트는 모델, 프레임워크, 플러그인, API, 데이터 세트, 소프트웨어 패키지, 외부 서비스에 의존한다. 손상된 구성 요소나 조작된 데이터 소스는 에이전트가 무엇을 믿고, 무엇을 추천하며, 어떤 행동을 실행할지를 바꿀 수 있다.
조직은 AI 관련 자산과 의존성을 파악하고, 모델과 도구의 출처를 검토해야 한다. 신뢰할 수 있는 버전을 고정하고, 구성 요소를 지속적으로 검사하며, 외부 통합 서비스에서 발생하는 비정상적인 행동을 감시하는 과정도 필요하다.
개별 신원과 최소 권한 원칙
운영 환경에서 사용되는 각 에이전트에는 독립적이고 추적 가능한 신원이 필요하다. 개인 계정, 공용 서비스 계정, 장기간 유효한 공통 자격 증명을 여러 에이전트가 공유해서는 안 된다.
분리된 신원을 사용하면 담당자를 지정하고, 정책을 적용하고, 자격 증명을 교체하며, 사고 원인을 조사하기가 쉬워진다. 문제가 발생한 에이전트의 접근을 신속하게 차단할 수도 있다.
권한은 역할, 업무, 데이터 소스, 실행 환경, 작업 유형에 따라 제한해야 한다. 고객 기록을 요약하는 에이전트에 전체 데이터베이스를 수정할 수 있는 권한은 필요하지 않다. 읽기와 쓰기 권한을 분리하고, 가능한 경우 단기 자격 증명을 사용하며, 불필요한 권한은 제거해야 한다.
도구와 API에는 기본 거부 원칙을 적용하는 것이 바람직하다. 승인된 각 통합 기능에는 명확한 입력 형식, 접근 범위, 호출 한도, 출력 처리 규칙, 감사 기록이 있어야 한다. 민감한 도구는 요청을 실제 시스템으로 전달하기 전에 검사하는 보안 게이트웨이 뒤에 배치해야 한다.
입력과 출력, 메모리를 신뢰하지 않는 설계
사용자, 웹사이트, 이메일, 문서, 외부 도구의 응답에서 전달된 정보가 자동으로 안전하다고 가정해서는 안 된다. 신뢰할 수 있는 시스템 지시와 외부 콘텐츠를 명확하게 분리하고, 검색된 정보의 출처와 사용자의 접근 권한을 확인해야 한다.
출력 검증도 중요하다. 에이전트가 생성한 내용은 명령줄, 브라우저, SQL 클라이언트, 메시징 플랫폼 또는 업무용 애플리케이션의 입력으로 사용될 수 있다. 실행 전에 매개변수를 엄격한 스키마와 정책에 따라 검사하고, 삭제나 외부 전송처럼 영향이 큰 작업에는 명시적인 승인을 요구해야 한다.
지속형 메모리에 정보를 기록할 수 있는 사용자와 프로세스를 제한할 필요도 있다. 저장된 정보의 출처를 남기고, 새로운 항목을 검사하며, 더 이상 필요하지 않은 기록에는 만료 정책을 적용해야 한다. 에이전트의 메모리는 무조건 신뢰할 수 있는 지식이 아니라 공격받을 수 있는 데이터 저장소다.
실행 시간 모니터링과 인간의 승인
배포 전 테스트만으로 자율 에이전트가 선택할 모든 행동 경로를 예측할 수는 없다. 실행 시간 모니터링은 프롬프트, 검색된 컨텍스트, 권한 검사, 도구 호출, 메모리 변경, 차단된 요청, 인간의 승인, 최종 행동을 포함해야 한다.
비정상적인 도구 호출 순서, 반복되는 접근 거부, 예상하지 못한 외부 목적지, 갑작스러운 데이터 전송 증가, 권한 변경, 에이전트의 정의된 목적을 벗어난 행동에는 경고가 필요하다. 위험도가 높은 환경에서는 에이전트를 중지하고, 자격 증명을 취소하며, 안전하지 않은 업무 흐름을 즉시 종료할 수 있어야 한다.
모든 작업에 수동 검토가 필요한 것은 아니다. 반복적이고 되돌릴 수 있으며 위험이 낮은 작업은 자동화할 수 있다. 그러나 운영 데이터, 금융 자산, 접근 권한, 외부 커뮤니케이션, 규제 대상 정보에 영향을 미치는 행동에는 추가 정책 검사와 인간의 승인이 필요하다.
AI 에이전트 보안의 핵심은 자율성과 책임성을 결합하는 것이다. 명확한 신원, 최소 권한, 통제된 도구, 보호된 컨텍스트, 지속적인 모니터링, 위험 기반 인간 승인이 함께 작동할 때 다층적인 방어 체계가 완성된다.
KAEL AI는 에이전트 거버넌스와 신뢰할 수 있는 자동화에 관한 실용적인 관점을 Facebook과 X에서 지속적으로 공유하며, 조직이 가시성이나 통제력, 책임성을 포기하지 않고 자동화 역량을 확장할 수 있도록 지원한다.
