6.7

View in English

6.7 AI 에이전트와 에이전트 시스템

개요와 동기

AI 에이전트는 루프로 감싼 대규모 언어 모델(LLM)입니다. 목표가 주어지고, 도구를 호출할 수 있고, 지금까지 한 일의 일부 기억을 유지하며, 목표가 이루어지거나 포기할 때까지 스스로 다음 단계를 결정합니다. 그 루프가 에이전트와 6.3장의 단순한 프롬프트-응답 호출의 전체 차이입니다. 단일 호출은 질문에 답합니다. 에이전트는 이메일을 읽고, 데이터베이스를 검색하고, 티켓을 등록하고, 결과를 확인하고, 다시 시도합니다. 모델은 더 이상 텍스트를 생성하기만 하는 것이 아니라 여러분의 시스템에서 행동을 선택합니다.

그 변화는 엔지니어링 문제를 바꿉니다. 모델이 말만 쓸 때 나쁜 출력은 나쁜 문장입니다. 모델이 도구를 몰 때 나쁜 출력은 잘못된 메시지를 보내거나, 기록을 삭제하거나, 돈을 옮길 수 있습니다. 그래서 지능형 에이전트는 신뢰되는 시스템 안에 앉은 신뢰할 수 없는 계획자로 이해하는 것이 가장 좋고, 작업의 대부분은 그 계획자가 할 수 있는 일을 제한하는 데 들어갑니다. 이 장은 6.3장의 LLM 기초, 6.5장의 신뢰와 책무에 대한 관심, 6.6장의 플랫폼 실천 위에 직접 서 있습니다.

큰 팀에게 판돈은 기술만큼 조직적입니다. 기업은 에이전트가 실제 내부 시스템(티켓팅, 재무, 고객 기록)에 연결되기를 원하며, 이는 에이전트가 실제 접근 통제와 실제 변경 관리 의무를 물려받는다는 뜻입니다. 정부는 공적 책임을 더합니다. 시민에게 영향을 주는 자율적 행동은 사후에 설명 가능하고, 감독 가능하고, 감사 가능해야 합니다. 이 패턴은 강력합니다. 규율 없이 배포하면 실수를 자동화하는 빠른 방법입니다.

핵심 원칙

  • 에이전트는 모델 더하기 루프, 도구, 메모리, 목표입니다. 위험은 글이 아니라 루프에 삽니다.
  • 자율성을 과업에 한정하십시오. 일을 해내는 가장 적은 양의 자유를 주십시오.
  • 단계를 알 때는 고정된 워크플로를 선호하십시오. 모를 때만 개방형 자율성에 손을 뻗으십시오.
  • 모든 도구를 공격 표면으로 다루고, 동작할 수 있는 최소 권한을 주십시오.
  • 중대하거나 되돌릴 수 없는 행동에는 사람을 루프에 두고, 되돌리기를 싸게 만드십시오.
  • 기록이 어떻게 읽히는지가 아니라 과업 성공으로 평가하십시오.
  • 모든 실행을 추적하십시오. 재구성할 수 없는 행동은 다스릴 수 없는 행동입니다.
  • 동작하는 가장 단순한 설계가 대개 옳습니다. 흔히 그것은 에이전트가 아닙니다.

권장 사항

워크플로로 시작하고, 꼭 필요한 곳에만 자율성을 더한다

가장 흔한 실수는 고정된 파이프라인으로 될 일에 자율 에이전트에 손을 뻗는 것입니다. 단계를 이미 안다면(필드 추출, 검증, 기록 조회, 답장 초안 작성) 그것을 모델이 특정 슬롯을 채우는 오케스트레이션된 워크플로로 쓰십시오. 자율성이 값을 하는 때는 경로를 정말로 미리 정할 수 없을 때, 예컨대 개방형 조사나 많은 가능한 도구에 걸친 분류입니다. 자율성을 과업에 한정하십시오. 단계 수의 상한을 두고, 도구 집합을 이 목표에 필요한 것으로 제한하고, 분명한 중단 조건을 정하십시오. 좋은 규칙은 모델에 문제가 요구하는 만큼의 자유를, 한 치도 더 주지 않는 것입니다.

도구 사용을 핵심 역량으로 삼고, 안전하게 만든다

도구 사용(함수 호출이라고도 함)이 모델을 에이전트로 바꿉니다. 각 도구를 정확한 스키마로 정의하고, 모델이 제공하는 모든 인수를 검증하고, 최소 권한의 원칙을 적용하십시오. 읽기 전용 보고 에이전트에는 읽기 전용 자격 증명을 주고, 오용할 수 있는 쓰기 접근은 결코 주지 마십시오. 나쁜 호출이 피해 범위 너머에 닿지 못하도록 도구를 샌드박스 안에서 실행하십시오. 몇 개의 넓은 도구보다 많은 좁은 단일 목적 도구를 선호하십시오. 좁은 도구가 추론하고, 권한을 주고, 감사하기 더 쉽기 때문입니다. 이는 6.3장이 LLM 도구 사용에 촉구하는 것과 같은 절제를 중심에 둔 것입니다.

명시적 추론과 계획 패턴을 쓴다

에이전트는 생각이 구조화되어 있을 때 더 잘 동작합니다. 추론-행동 패턴(ReAct 연구로 대중화됨)에서 모델은 상황에 대한 추론과 행동 취하기를 번갈아 하고, 다시 추론하기 전에 결과를 관찰합니다. 더 어려운 목표에서는 모델이 먼저 계획하고(하위 과업으로 분해) 그다음 실행하게 하여, 어떤 도구도 실행되기 전에 계획을 살펴보고 승인할 수도 있게 하십시오. 이 루프를 관찰 가능하고 중단 가능하게 유지하십시오. 읽을 수 있는 계획은 멈출 수 있는 계획입니다.

중대한 행동에는 사람을 루프에 둔다

도구별로 그리고 행동별로, 모델이 단독으로 행동해도 되는지 먼저 물어야 하는지 결정하십시오. 되돌릴 수 있고 판돈이 낮은 행동(검색, 초안 작성)은 무인으로 돌아도 됩니다. 중대하거나 되돌릴 수 없는 것(외부 통신 발송, 송금, 프로덕션 데이터 변경, 시민의 사안 결정)은 거부할 진짜 권한이 있는 사람 개입 관문이 필요합니다. 할 수 있는 곳에서는 되돌릴 수 있게 설계하십시오. 변경을 커밋하기보다 스테이징하는 것을 선호하고, 잘못된 행동이 사고가 아니라 몇 분의 비용이 되도록 되돌리기를 일급 기능으로 만드십시오.

보안 모델을 적대적으로 다룬다

에이전트는 4.2장에 기술된 공격 표면을 넓힙니다. 대표적 위협은 프롬프트 인젝션입니다. 에이전트가 읽고 따르는 웹 페이지, 문서, 이메일에 숨은 악의적 지시입니다. 밀접하게 관련된 것이 혼동된 대리인 문제로, 공격자가 권한 있는 에이전트를 속여 자신의 정당한 접근을 오용하게 하는 것입니다. 예컨대 에이전트가 호출할 수 있는 도구를 통한 데이터 유출입니다. 에이전트가 받아들이는 모든 콘텐츠가 적대적일 수 있다고 가정하십시오. 신뢰되는 지시와 신뢰할 수 없는 데이터를 분리하고, 가로채인 에이전트가 민감한 시스템에 닿지 못하도록 도구를 제약하고, 검증 없이 원시 모델 출력이 되돌릴 수 없는 행동을 촉발하게 두지 마십시오.

과업 성공으로 평가하고 비결정성을 회귀 테스트한다

에이전트를 기록이 똑똑하게 들리는지가 아니라 과업을 달성하는지로 판단하십시오. 확인 가능한 성공 기준이 있는 대표적 목표의 평가 세트(티켓에 올바른 우선순위가 부여되었는가, 환불이 정책에 맞았는가)를 만들고 모든 프롬프트, 모델, 도구 변경마다 돌리십시오. 에이전트는 비결정적이므로 한 번의 통과는 거의 증명하지 못합니다. 각 사례를 여러 번 돌리고 통과 또는 실패가 아니라 성공률을 추적하십시오. 이는 6.3장과 6.2장(머신러닝 엔지니어링과 MLOps)의 오프라인 및 온라인 평가 규율을 출력이 행동의 연쇄인 시스템으로 확장한 것입니다.

관측 가능성, 비용, 실패 처리를 위해 실행을 계측한다

볼 수 없는 것은 다스릴 수 없습니다. 모든 에이전트 실행을 끝에서 끝까지 추적하십시오(6.6장). 목표, 각 추론 단계, 인수와 결과가 있는 모든 도구 호출, 소비한 토큰, 최종 결과입니다. 이 추적이 디버거이자, 감사 추적이자, 비용 계량기 역할을 한꺼번에 합니다. 루프를 도는 에이전트는 지연과 돈을 빠르게 태울 수 있으므로 단계, 시간, 지출에 하드 예산을 정하십시오. 실패를 명시적으로 처리하십시오. 일시적 도구 오류는 백오프와 함께 재시도하되, 모델이 실패하는 행동을 반복하는 루프를 탐지하고 허우적대기보다 안전하게 실패하십시오.

장단점

선택장점단점가장 적합한 때
고정된 워크플로 (모델이 슬롯을 채움)예측 가능하고, 싸며, 테스트와 감사가 쉬움경직됨. 예상 못한 경로에서 깨짐단계를 미리 알 때
자율 단일 에이전트유연함. 개방형 목표를 처리통제, 평가, 한정이 더 어려움경로를 미리 정할 수 없을 때
멀티 에이전트 오케스트레이션병렬성. 특화된 역할조율 비용, 누적되는 오류, 더 높은 지출과업이 정말로 독립적인 부분으로 분해될 때
무인 행동빠르고 마찰이 적음실수가 검사 없이 실행됨행동이 되돌릴 수 있고 판돈이 낮을 때
사람 개입 관문안전, 책무, 되돌릴 수 있음더 느림. 리뷰어 역량 필요행동이 중대하거나 되돌릴 수 없을 때

중심 긴장은 자율성 대 통제입니다. 더 많은 자율성은 더 많은 상황을 처리하지만 더 많은 가드레일, 더 많은 평가, 더 많은 돈을 요구하고, 예측하기 더 어려운 방식으로 실패합니다. 멀티 에이전트 설계는 팀을 우아함으로 유혹하지만, 추가된 에이전트마다 조율 오버헤드와 작은 오류가 틀린 결과로 누적될 또 하나의 자리를 더합니다. 문제를 푸는 가장 적은 자율성으로 시작하고, 구체적 과업이 강제할 때만 자유를 더하고, 항상 대응하는 가드레일과 짝지움으로써 긴장을 해결하십시오.

팀과 논의할 질문

  1. 이 기능은 정말 에이전트가 필요합니까, 아니면 고정된 워크플로가 더 안전하고 쌉니까? 자율성은 유혹적이지만 대부분의 일에는 오케스트레이션된 파이프라인이 훨씬 적은 위험으로 처리하는, 알 수 있는 단계가 있습니다. 큰 팀에서 에이전트를 기본값으로 삼으면 모든 그룹이 더 단순한 설계가 피했을 평가, 추적, 보안 부담을 집니다. 구체적 과업을 가져와 단계를 미리 정할 수 있는지 물으십시오. 그럴 수 있다면 에이전트는 과잉 설계일 가능성이 큽니다. 개방형 자율성은 경로가 사례마다 정말로 달라지는 목표에 남겨 두십시오. 답은 대부분의 기능을 워크플로 쪽으로 밀고 작고 의도적인 집합만 진짜 에이전트로 남겨야 합니다.

  2. 에이전트가 호출할 수 있는 모든 도구에 대해, 가로채인 에이전트가 그것으로 할 수 있는 최악은 무엇이며, 무엇이 그것을 막습니까? 프롬프트 인젝션과 혼동된 대리인 공격은 에이전트 자신의 정당한 접근을 여러분에게 맞서게 하므로, 올바른 렌즈는 적대적인 것입니다(4.2장). 각 도구, 그 권한 범위, 받아들인 콘텐츠를 통해 몰래 들어온 악의적 지시가 그것에 닿을 수 있는지를 목록으로 만드십시오. 에이전트를 내부 시스템에 연결하는 기업에서, 여기가 최소 권한, 샌드박싱, 되돌릴 수 없는 행동에 대한 사람 관문이 현실이 되는 곳입니다. 도구 목록과 각각이 쥔 자격 증명을 가져오십시오. 중대한 행동이 검증이나 사람의 확인 없이 닿을 수 있다면, 그것이 먼저 고칠 것입니다.

  3. 모든 실행이 그럴듯해 보이는데, 에이전트의 성공률이 떨어졌음을 어떻게 알겠습니까? 에이전트는 비결정적이므로 잘 읽히는 기록도 잘못된 행동을 취했을 수 있고, 초록 실행 한 번은 아무것도 증명하지 못합니다. 확인 가능한 결과가 있는 목표의 평가 세트가 있는지, 단일 통과가 아니라 성공률을 내도록 사례마다 여러 번 돌리는지 물으십시오. 고위험이나 공개 배포에서는 무언가 잘못될 때 정확히 무슨 일이 있었는지 실행 추적이 어떻게 재구성하게 해 주는지 논의하십시오(6.5장과 6.6장). 유일한 신호가 사용자 불만이라면 이미 너무 늦은 것입니다. 답은 사고 후가 아니라 규모 전에 평가 하네스에 자금을 대야 합니다.

  4. 이 에이전트의 행동 중 진짜 되돌릴 수 없는 것은 어느 것이며, 누가 승인할 권한을 갖고, 그 관문에 인력을 둘 리뷰어 역량이 있습니까? 유혹은 모델이 어디서나 무인으로 행동하게 두는 것이지만, 사람 관문은 에이전트가 물을 때 거부할 권한이 있는 지명된 사람이 있을 때만 진짜입니다. 큰 팀에서 아무도 소유하지 않는 승인 대기열은 조용히 도장 찍기가 되고, 설계한 안전은 물량 아래서 증발합니다. 에이전트가 취할 수 있는 모든 행동의 전체 목록을 가져와 각각을 되돌릴 수 있음 또는 없음으로 표시하고, 리뷰어에게 떨어질 낮은 확신 사례의 일일 물량을 추정하십시오. 관문의 마찰과 인력 비용을 무인 실수의 피해 범위에 견주어 저울질하고, 리뷰어를 하나 더 두기보다 되돌릴 수 없는 행동을 스테이징되고 되돌릴 수 있는 것으로 재설계하는 쪽을 선호하십시오. 기업과 정부 환경에서는 각 중대한 행동을 책임 있는 담당자와 변경 관리 기록에 묶으십시오. 아무 사람도 승인하지 않은, 시민이나 고객에게 영향을 주는 자율적 행동이 바로 감사가 찾아낼 실패이기 때문입니다.

  5. 멀티 에이전트 설계에 손을 뻗는 것은 과업이 정말로 분해되기 때문입니까, 아니면 우아해 보이기 때문입니까? 작업을 특화된 에이전트에 나누는 것은 유혹적이지만, 추가된 에이전트마다 조율 오버헤드와 작은 오류가 틀린 결과로 누적될 또 하나의 자리를 더합니다. 큰 조직에서 비용은 지출과 지연만이 아닙니다. 멀티 에이전트 시스템은 실패할 때 추적, 평가, 추론하기 훨씬 어려워, 역할을 하나 더할 때마다 거버넌스 부담이 곱해집니다. 과업을 가져와 어느 부분이 독립적으로 병렬로 돌아가는지 구체적으로 보이고, 같은 평가 세트에서 멀티 에이전트 버전의 측정된 성공률과 비용을 단일 에이전트와 비교하십시오. 단일 에이전트가 이기거나 비기면 우아한 설계는 과잉 설계입니다. 규제 또는 공공 배포에서는 사슬의 모든 에이전트가 감독 기관이 살펴볼 수 있어야 하는 또 하나의 구성 요소임을 기억하십시오. 정당화할 수 없는 추가된 구조는 추가된 부채입니다.

  6. 에이전트의 단계, 시간, 지출에 대한 하드 예산은 무엇이며, 루프를 도는 에이전트를 비용이나 지연이 불어나기 전에 어떻게 잡겠습니까? 실패하는 행동을 반복하는 에이전트는 경고 없이 돈과 시간을 태울 수 있으므로, 무제한 자율성은 안전만큼이나 재정적 위험입니다. 많은 에이전트를 운영하는 큰 팀에서 오작동하는 단일 루프가 클라우드 청구서를 치솟게 하거나 다른 모든 워크로드를 굶기는 속도 제한을 소진할 수 있어서, 실행당 상한은 한 팀의 문제가 아니라 공유된 운영상의 관심사가 됩니다. 각 에이전트의 현재 단계, 시간, 토큰 예산, 실행이 이를 넘을 때 발동하는 알림, 허우적대기보다 안전하게 실패하는 루프 탐지를 가져오십시오. 정말 어려운 과업을 끊을 수 있는 엄격한 예산을 비용이 폭주하게 두는 느슨한 예산에 견주어 저울질하십시오. 지출을 예측하고 정당화해야 하는 기업과 정부 환경에서 비용이 무제한인 에이전트는 예산 리뷰나 감사에서 방어할 수 없는 항목입니다.

분야별 관점

스타트업. 핵심 가치에 닿는 좁은 에이전트 하나를 호스팅 모델 위에, 일을 하는 가장 작은 도구 집합과 단계 및 지출의 엄격한 상한과 함께 출하하십시오. 멀티 에이전트 시연에 저항하십시오. 희소한 엔지니어링 주의는 유지할 수 없는 역할을 조율하는 것보다 단일 에이전트의 자율성을 한정하고 실행을 추적하는 데 쓰는 편이 낫습니다. 모든 중대한 행동을 하나의 “초안만 쓰고 절대 보내지 않음” 관문 뒤에 두어 실수가 사고가 아니라 클릭 한 번으로 되돌릴 수 있게 하십시오.

소기업. 평가 하네스나 샌드박스를 운영할 사람이 없으니, 이미 신뢰하는 도구에 내장된 에이전트를 선호하고 눈으로 감독할 수 있는 자율성만 켜십시오. 여러분을 대신해 보내고, 결제하고, 삭제할 수 있는 에이전트는 사람이 각 행동을 확인할 때까지 꺼 두십시오. 고객에게 가는 틀린 자동 메시지는 관계를 잃게 하기 때문입니다. 에이전트가 무엇을 했는지 보여 주고 자동화를 끌 수 있게 하는 벤더를 선호하십시오.

대기업. 문제는 많은 팀에 걸친 에이전트 거버넌스입니다. 자율성 한정, 최소 권한 도구 자격 증명, 샌드박싱, 사람 개입 관문, 어떤 그룹도 가드레일을 다시 발명하지 않도록 하는 끝에서 끝까지의 추적에 대한 공유 패턴입니다. 에이전트를 사람이 쥘 것과 같은 접근 통제 아래 내부 시스템에 연결하고, 되돌릴 수 없는 행동을 지명된 승인자와 변경 관리 뒤에 관문 통제하고, 성공률 지표, 실행당 예산, 적대적 인젝션 테스트로 포트폴리오를 관리하십시오. 어떤 에이전트의 행동이든 재구성되고 감사될 수 있도록 추적과 평가 계층을 표준화하십시오.

정부. 조달, 투명성, 공적 책임이 모든 선택을 한정합니다. 에이전트는 사실 수집과 초안 작성에 두고, 공공 부문 결정의 책임은 모델에 위임할 수 없으므로 시민에게 영향을 주는 모든 결정은 책임 있는 사람에게 남기십시오. 감독 기관이 어떤 출처를 참조하고 무엇을 했는지 볼 수 있도록 모든 실행을 기록하고, 벤더가 에이전트의 도구와 한계를 공개하도록 요구하고, 에이전트가 한정된 권한 너머로 행동하기를 거부함을 적대적 평가 세트로 입증하십시오.

사례

스타트업. 다섯 명의 분석 스타트업이 지원 분류 에이전트를 만듭니다. 들어오는 티켓을 읽고, 문서를 검색하고, 답장 초안을 쓰거나 티켓을 사람에게 라우팅하며, 그것이 도구 집합의 전부입니다. 자격 증명은 읽기 전용에 사람이 보내기를 클릭하지 않으면 결코 보내지 않는 단일 “초안 생성” 행동이 더해진 것입니다. 창업자들이 티켓이 왜 그렇게 라우팅되었는지 볼 수 있도록 모든 실행이 추적되고, 실제 티켓 쉰 개의 야간 평가 세트가 라우팅 정확도를 추적하려고 에이전트를 각 다섯 번씩 돌립니다. 경쟁사의 영리한 멀티 에이전트 시연이 유혹해도, 과업이 분해되지 않기 때문에 단일 에이전트로 남습니다.

기업. 한 은행이 운영 직원이 실패한 결제를 대사하도록 돕는 에이전트를 만듭니다. 사람 사무원이 가진 것과 같은 접근 통제 아래 내부 시스템과 통합되며, 대사에만 범위가 정해진 최소 권한 서비스 자격 증명으로 부여됩니다. 에이전트는 자유롭게 조사할 수 있지만(원장을 읽고, 거래 이력을 검색) 돈을 옮기거나 기록을 편집하는 모든 행동은 스테이징되고 지명된 사람 승인자를 요구하여 변경 관리를 충족합니다. 받아들인 문서는 프롬프트 인젝션을 무디게 하려고 신뢰할 수 없는 것으로 다뤄지고, 도구는 샌드박스에서 실행되며, 모든 실행이 감사를 위해 끝에서 끝까지 추적됩니다. 오프라인 평가 세트가 모든 모델이나 프롬프트 변경을 관문 통제하고, 실행당 예산이 단계와 지출의 상한을 두어 루프를 도는 에이전트가 비용이나 지연을 불리지 못합니다.

정부. 한 급여 기관이 담당 직원이 청구의 사실을 모으도록 돕는 에이전트를 시범 운영합니다. 기록을 가져오고, 자격 규칙을 확인하고, 요약을 초안합니다. 기관은 단호한 선을 긋습니다. 에이전트는 모으고 초안을 쓰지만, 공공 부문 결정의 책무는 모델에 위임할 수 없으므로(6.5장), 시민에게 영향을 주는 모든 결정은 사람 담당 직원이 내리고 소유합니다. 감독 기관이 어떤 사례든 감사할 수 있도록, 각 실행은 어떤 출처를 참조하고 무엇을 초안했는지 보여 주며 완전히 기록됩니다. 자율성은 의도적으로 읽고 초안 쓰기에 한정되고, 도구는 최소 권한이며 샌드박스 안에 있고, 적대적 평가 세트가 에이전트가 사실 수집 너머로 행동하기를 거부함을 확인합니다.

비즈니스 사례: 동기, ROI, TCO

에이전트는 시스템 사이를 클릭하는 사람이 필요했던 다단계 작업, 곧 분류, 대사, 조사, 일상 운영을 자동화해 수익을 줍니다. 가치는 모든 단계에 사람이 없이 완료되는 작업, 더 빠른 주기 시간, 판단이 많이 드는 과업에 풀려난 직원으로 나타납니다. 에이전트가 기존 LLM과 도구 위에 만들어지므로 동작하는 프로토타입까지의 시간이 짧고, 바로 그래서 팀이 과잉 구축합니다.

총소유비용이 에이전트가 단순한 LLM 기능과 다른 곳입니다. 추론 비용에 더해 도구 통합, 샌드박싱과 권한 배관, 평가 하네스, 추적 및 관측 가능성 스택(6.6장), 승인 관문에 인력을 두는 사람 리뷰어에 값을 치릅니다. 루프를 돌거나 잘 한정되지 않은 에이전트는 경고 없이 치솟을 수 있는 가변 비용을 더하므로, 단계와 지출의 예산은 사후 고려가 아니라 설계의 일부입니다. 도입하지 않는 비용은 경쟁사가 자동화하는 더 느린 운영과 수작업 고역입니다. 부주의하게 도입하는 비용은 잘못된 메시지를 보내거나, 데이터를 유출하거나, 책임질 수 없는 결정을 내리는 자율적 행동입니다. 구체적인 자동화 목표 하나를 가드레일, 평가, 사람 감독의 구체적 계획과 짝지우고, 가드레일이 비용의 대부분임을 정직하게 말해 리더십을 설득하십시오.

안티패턴과 함정

  • 워크플로로 될 일에 에이전트. 단계를 알 수 있던 과업에 자율성의 전체 위험을 지는 것.
  • 지나치게 넓은 도구와 자격 증명. 좁고 최소 권한인 것들 대신 “무엇이든 하는” 도구 하나.
  • 프롬프트 인젝션 맹목. 실제 권한을 쥔 에이전트에게 신뢰할 수 없는 콘텐츠를 먹이는 것.
  • 되돌릴 수 없는 행동에 사람 관문 없음. 모델이 확인 없이 보내고, 결제하고, 삭제하게 두는 것.
  • 멀티 에이전트 연극. 단순한 과업을 에이전트에 나눠 이득 없이 조율 비용을 치르는 것.
  • 느낌 기반 평가. 과업 성공률 대신 기록이 어떻게 읽히는지로 판단하는 것.
  • 무제한 루프. 단계, 시간, 지출의 상한이 없어 막힌 에이전트가 돈과 지연을 태우는 것.
  • 추적되지 않는 실행. 에이전트가 무엇을 했는지의 기록이 없어 디버깅, 감사, 설명을 할 수 없는 것.

성숙도 모델

  • 1단계, 시작: 에이전트가 넓은 도구 접근과 한정 없이 즉흥적으로 프로토타이핑됩니다. 성공은 시연으로, 무언가 깨진 뒤에 반응적으로 판단됩니다. 평가 세트도, 추적도, 중대한 행동에 대한 사람 관문도 없습니다.
  • 2단계, 발전: 일부 에이전트에 한정된 루프와 최소 권한 도구가 있고 기본적 추적이 있지만, 실천은 팀마다 다릅니다. 수동 평가 세트가 몇몇 프로젝트의 큰 회귀를 잡는 반면 다른 곳에는 없습니다. 사람의 승인이 가장 명백한 되돌릴 수 없는 행동을 지키지만, 커버리지는 고르지 않고 문서화되어 있지 않습니다.
  • 3단계, 표준화: 공유 패턴이 자율성, 도구 권한, 샌드박싱, 사람 개입 관문을 다스리며, 모든 팀에 걸쳐 문서화되고 시행됩니다. 모든 중대한 행동이 관문 통제되거나 검증되고, 에이전트가 끝에서 끝까지 추적되며, 성공률 점수화가 있는 자동화된 평가 세트가 모든 변경마다 돕니다. 프롬프트 인젝션은 정의된 대응이 있는 상시 위협으로 다뤄집니다.
  • 4단계, 관리: 에이전트 포트폴리오가 기준선에 대해 측정되고 통제됩니다. 과업당 성공률, 프롬프트 인젝션 방어 통과율, 실행당 비용과 단계 수, 사람 승인 지연, 루프 또는 실패 사고가 지표로 추적되고, 롤백과 중단 임계값이 불만이 아니라 그 증거에 따라 시행됩니다. 단계, 시간, 지출의 실행당 예산이 모니터링되고, 어떤 지표의 회귀든 사고 후가 아니라 규모 전에 행동을 촉발합니다.
  • 5단계, 오케스트레이션: 자율성이 정책에 의해 과업의 위험에 맞춰지고 결과가 들어옴에 따라 지속적으로 조정됩니다. 지속적인 오프라인 및 온라인 평가가 에이전트 행동을 비즈니스 성과에 묶고, 조직은 위험 상황이 이동함에 따라 에이전트를 일상적으로 퇴역시키고, 범위를 다시 정하고, 권한을 다시 부여합니다. 추적, 비용 예산, 감사 추적은 포트폴리오 전반에 균일하고, 인젝션과 혼동된 대리인 방어가 적대적으로 테스트되며, 자율적 행동에 대한 책무가 분명하고 감사 가능합니다.

논의를 위한 아이디어

  1. 현재 LLM 기능 중 어느 것이 조용히 에이전트가 되었으며, 각각의 자율성이 의도적으로 한정되었습니까?
  2. 각 에이전트 도구에 대해, 공격자가 주입된 콘텐츠를 통해 그것을 악용하는 가장 싼 방법은 무엇이며, 무엇이 그것을 막습니까?
  3. 어디서 멀티 에이전트 설계를 택했으며, 단일 에이전트에 견주어 조율 비용이 보답했음을 보일 수 있습니까?
  4. 어떤 에이전트 행동이 진짜 되돌릴 수 없으며, 그 모두를 되돌릴 수 있거나 스테이징되도록 재설계할 수 있습니까?
  5. 내일 에이전트가 해로운 행동을 했다면, 정확히 무엇을 했고 누가 책임지는지 재구성할 수 있습니까?

핵심 요점

  • 에이전트는 도구, 메모리, 목표가 있는 루프 속의 LLM입니다. 위험은 텍스트가 아니라 루프와 도구에 삽니다.
  • 단계를 알 때는 고정된 워크플로를 선호하고, 자율성은 진정으로 개방형인 목표에 남겨 두되 엄격히 한정하십시오.
  • 도구 사용이 핵심 역량입니다. 각 도구에 최소 권한, 검증된 스키마, 샌드박스를 주십시오.
  • 중대하고 되돌릴 수 없는 행동은 실질적 권한이 있는 사람 뒤에 관문 통제하고, 싼 되돌리기를 위해 설계하십시오.
  • 에이전트를 적대적으로 다루십시오. 프롬프트 인젝션과 혼동된 대리인 남용에 대비하십시오(4.2장).
  • 여러 실행에 걸친 과업 성공률로 평가하고, 디버깅, 비용 통제, 감사를 위해 모든 실행을 추적하십시오(6.5장과 6.6장).
  • 흔히 옳은 답은 에이전트를 아예 만들지 않는 것입니다.

참고 문헌과 더 읽을거리

  • Shunyu Yao et al., ReAct: Synergising Reasoning and Acting in Language Models.
  • Timo Schick et al., Toolformer: Language Models Can Teach Themselves to Use Tools.
  • Anthropic, Building Effective Agents (engineering guidance on workflows versus agents).
  • OWASP Foundation, OWASP Top 10 for Large Language Model Applications (including prompt injection and excessive agency).
  • Simon Willison, writing on prompt injection and the “lethal trifecta” for AI agents.
  • Norman Hardy, The Confused Deputy (the classic statement of the confused-deputy problem).
  • Chip Huyen, AI Engineering: Building Applications with Foundation Models.
  • Stuart Russell and Peter Norvig, Artificial Intelligence: A Modern Approach (intelligent agents and rational action).