AX Case BlogAI 전환 사례 연구

전체 사례No. 009

Brex BPO 운영을 에이전트 플랫폼과 3단계 직무 체계로 재설계하다

사례 번호
009
1차 출처
First Round Applied Intelligence
원문 게시
2025-09-25

1. 왜 이 사례인가

생성형 AI를 도입하려는 많은 금융·기술 기업이 겪는 공통된 병목은 두 가지입니다. 첫째는 외부 보안·컴플라이언스 심사 때문에 PoC에서 프로덕션으로 넘어가지 못하는 기술적 지연이고, 둘째는 AI를 도입해도 사람의 기존 역할과 조직 구조가 그대로 유지되어 실질적인 비용·운영 구조 혁신으로 이어지지 못하는 조직적 지연입니다.

Brex는 이 두 장벽을 엔지니어링 플랫폼과 운영 조직의 전면 재설계로 돌파했습니다. CTO James Reggio와 COO Camilla Matias가 주도한 이 전환은 AI를 단순한 직원용 비서(Copilot)로 배포하는 데 그치지 않고, 고객용 제품(Product AI)과 사내 운영(Operational AI)이 공유하는 사내 에이전트 플랫폼(Agent Platform)을 구축하는 것에서 출발했습니다.

운영 조직에서는 외주 BPO(비즈니스 프로세스 아웃소싱)에 의존하던 수동 처리 업무를 에이전트에 맡기고, 사람의 역할을 L1(절차 실행)·L2(에이전트 관리 및 예외 처리)·L3(도메인 정책 및 시스템 설계)의 3단계로 재정의했습니다. 그 결과 분쟁 처리 시간은 3시간에서 3초로 줄었고, 고객 지원 대화의 50% 이상이 챗봇 첫 접점에서 해결되었으며, 전수(100%) 상시 품질 평가(QA)가 구축되었습니다. 이 사례는 AI 도입이 단순한 소프트웨어 도입이 아니라 직무 체계와 운영 거버넌스의 구조적 재편이어야 함을 보여줍니다.


2. Problem

전통적인 금융 서비스 운영은 규제 준수와 사기 방지를 위해 세분화된 전문 조직을 전제로 돌아갑니다. 신용 평가, 본인 확인(KYC), 결제 분쟁, 연체 계정 관리 등 각 영역마다 별도의 전문 인력과 복잡한 핸드오프 절차가 필요했습니다.

Brex의 운영 규모가 커지면서 다음과 같은 구체적 병목이 심화되었습니다:

  1. 외주 BPO 의존과 느린 처리 속도: 카드 분쟁 제기처럼 100페이지가 넘는 규칙집과 엄격한 절차서(SOP)를 기반으로 하는 업무는 BPO 인력의 수동 검토에 의존했습니다. 한 건을 처리하는 데 평균 3시간이 소요되었고, 처리 품질 편차도 컸습니다.
  2. 샘플링 기반 QA의 한계: 수많은 BPO 및 내부 상담원의 고객 응대 품질을 관리하기 위해 5명의 전문 QA 담당자가 일일이 표본을 추출해 분석했으나, 전체 상담량의 극히 일부만 검수할 수 있었습니다.
  3. 규제 및 조달 절차의 병목: 1,000명 이상의 조직에서 새로운 AI 도구를 도입할 때마다 개별 공급업체에 대한 보안·법무·조달 실사가 수개월씩 걸렸고, 승인이 날 무렵에는 이미 상위 기술이 등장해 도구가 뒤처지는 악순환이 발생했습니다.
  4. 전부 아니면 전무(All-or-Nothing) 함정: 업무 프로세스를 자동화할 때 100% 무인 처리를 목표로 잡다 보니, 주관적 판단이나 모호한 기준이 필요한 영역에서 프로젝트가 번번이 좌초되었습니다.

확인된 사실: BPO 기반의 수동 처리 의존, 분쟁 처리 건당 약 3시간 소요, 5명의 인력이 표본 샘플만 검수하던 QA 체계, 1,000명 이상 규모에서 발생하는 느린 조달·법무 병목, 14단계에 이르는 수동 KYC 절차.


3. Solution

Brex는 엔지니어링 기반의 플랫폼 구축과 운영 조직의 역할 재정의를 병렬로 진행했습니다.

3.1 공통 인프라: Retool 기반 사내 에이전트 플랫폼

Brex의 시스템 엔지니어링 팀(전체 350명 EPD 중 약 25명)은 사내 에이전트 플랫폼을 구축했습니다. 2023년 3월 OpenAI 개발자 플랫폼을 모방한 프로토타입에서 출발해, 프롬프트 관리 시스템, 다중 모델 벤치마킹 및 평가 프레임워크, 자동화 워크플로 연동 API를 갖춘 전사 플랫폼으로 발전했습니다.

특히 외부 고객용 제품과 사내 운영 도구가 동일한 모델 컨텍스트 프로토콜(MCP) 도구를 공유하도록 설계했습니다. 제품 기능 확장을 위해 새 도구를 MCP에 추가하면 사내 에이전트 플랫폼에서도 즉시 해당 도구를 호출해 운영 에이전트를 조립할 수 있는 제품 루프가 완성되었습니다.

3.2 데이터 수명주기 중심의 법무·보안 사전 승인 거버넌스

공급업체별로 진행하던 수개월 단위의 조달 심사를 데이터 수명주기 기반 통제 기준으로 전환했습니다:

  • 30일 이상 데이터를 보관하지 않음
  • 고객 입력을 모델 재학습에 활용하지 않음
  • 데이터 격리 보장

위 기준을 충족하는 도구는 사전 승인 카테고리로 분류했습니다. 개발 코드베이스는 ‘저위험 기업 데이터’로 재분류하고, 개별 계정 대신 사내 Retool 프록시를 통한 SSO 인증을 강제했습니다. 임직원은 Slack에서 /c1(ConductorOne) 명령어로 원하는 도구를 선택하면 백엔드 Okta를 통해 즉시 프로비저닝받는 셀프서비스 환경을 구축했습니다.

3.3 3단계 운영 직무 모델 (L1 / L2 / L3)

운영 조직의 역할을 작업 단위가 아닌 에이전트 관리 단위로 재편했습니다:

  • L1 (절차적 업무 실행): 정형화된 SOP를 따르던 기존 BPO 업무를 에이전트가 무인으로 직접 수행합니다. 고객 지원 대화의 50% 이상이 챗봇 1차 접점에서 종결됩니다.
  • L2 (에이전트 관리 및 예외 검토): 기존 일선 관리자와 시니어 분석가가 사람을 관리하는 대신 에이전트를 관리합니다. 성능 평가 대신 프롬프트를 피드백하고 품질 기준을 고도화합니다. 과거 5명이 표본을 보던 QA 업무를 단 1명의 리드가 전체 응대(100%)를 실시간 검수하는 AI QA 에이전트를 감독하는 형태로 개편했습니다.
  • L3 (도메인 전문가 및 시스템 설계자): 신용 전략, 이상 거래 탐지, 규제 컴플라이언스 전문가들이 에이전트와 사람이 협업하는 전체 시스템의 정책과 경계 조건을 설계합니다.

3.4 주요 운영 워크플로 자동화

  • 카드 분쟁 처리: 결제 운영 매니저(Kyle Martin)가 100페이지 분량의 마스터카드 분쟁 가이드와 BPO 절차서를 에이전트 플랫폼에 입력하고 프롬프트를 반복 고도화하여 워크플로 전체를 자동화했습니다.
  • 점진적 KYC 및 부정적 언론(Adverse Media) 탐지: 14단계 KYC 절차 중 주관적 판단이 덜한 8~10개 단계를 에이전트에 먼저 위임했습니다. 특히 모호성이 큰 부정 언론 탐지 작업에서 에이전트는 정밀도 88%를 기록해 사람의 기준선(85%)을 상회했습니다.
  • 연체 계정 맞춤형 회수 커뮤니케이션: 기존의 고정 이메일 템플릿 수정 방식을 벗어나, 고객 계정 이력과 협상 가이드라인을 반영해 강도와 어조가 다른 여러 선택지를 에이전트가 생성하고 담당자가 최종 선택·발송하도록 했습니다.

3.5 AI 유창성(Fluency) 평가 및 채용 기준 변경

전사 운영 인력을 대상으로 프롬프트 기법, 도구 활용(Cursor, NotebookLM 등), 워크플로 설계 교육을 의무화했습니다. 분기마다 4단계(User → Advocate → Builder → Native) 자가 평가를 거쳐 하위 25% 인원에게는 하루 3~5회 반복 업무를 자동화하는 실습 과제를 부여했습니다. 또한 비지원 부서 전원 채용 시 실제 비즈니스 시나리오(예: 7가지 딜 데스크 가격 책정)를 해결하는 AI 활용 케이스 스터디를 의무화하고 프롬프트 작성 내역과 사고 과정을 평가 요소로 삼았습니다.

확인된 사실: 25명 규모의 시스템 엔지니어링 팀이 Retool 기반 에이전트 플랫폼 운영, MCP 공통 사용, ConductorOne + Okta 사전 승인 조달 자동화, L1/L2/L3 조직 개편, 100% AI 전수 QA 구축, 15개 이상의 지원 직무 L2 전환, 4단계 유창성 프레임워크 운영.


4. Impact

First Round 인터뷰 원문에 공개된 측정 수치는 다음과 같습니다. 모든 지표의 기준일은 원문 인터뷰 발행 시점인 2025년 9월 25일입니다.

지표개선 성과비고
카드 결제 분쟁 처리 소요 시간3시간 → 3초Kyle Martin 운영 매니저 구축; 마스터카드 규정 추가 발굴
고객 지원 1차 접점 해결률> 50%생성형 AI 고객 지원 챗봇 도입 후 무인 완결 비율
QA 검수 커버리지 및 전담 인력표본 검수(5명) → 100% 전수 검수(1명)AI가 모든 대화를 검수하고 매니저는 에이전트 개선에 집중
부정적 언론(Adverse Media) 탐지 정확도85% (사람) → 88% (에이전트)KYC 14단계 중 비정형 뉴스 분석 단계
KYC 프로세스 자동화 비중14단계 중 8~10단계 위임확신도 높은 단계 우선 자동화, 예외는 사람 분석가 처리
직무 전환 규모15개 이상의 CS 역할 L2로 전환단순 대응(L1)에서 복잡 티켓 및 에이전트 관리(L2)로 상향
기준일2025-09-25First Round Applied Intelligence 인터뷰 기준

원문은 분쟁 신청서에 기재되는 논거의 질도 향상되었다고 기록합니다. 과거 BPO 담당자가 규정집에서 4~5개 논점을 찾아 기재했다면, 에이전트는 미처 검토하지 못했던 2~3개 추가 규정을 더 찾아내 설득력 있는 문서로 요약했습니다.


5. Insight

Brex의 사례는 AI 에이전트를 실무 운영 코어에 안착시키기 위해 필요한 조직적 전제들을 명확히 보여줍니다.

도구 도입이 아닌 인프라 통일입니다. 고객용 제품을 개발하는 기술 스택과 사내 운영 자동화 스택을 분리하지 않고, 동일한 MCP와 에이전트 플랫폼으로 일원화했습니다. 개발팀이 제품용으로 만든 도구가 즉시 사내 운영 담당자의 에이전트 조립 도구로 재사용되는 선순환이 일어났습니다.

거버넌스의 관점 전환이 필요합니다. 공급업체 이름을 따지는 심사 대신 ‘데이터가 어떻게 처리·보관되는가’를 기준으로 자동 승인 경로를 열어주어 조직 내 도구 실험의 속도를 유지했습니다.

100% 자동화의 함정을 피해야 합니다. 단번에 전 과정을 무인화하려 하지 않고, 신뢰도가 확보된 40~80%의 단계만 먼저 떼어내 에이전트에 넘겼습니다. 모호성이 남는 예외 구간은 사람이 검토하도록 설계함으로써 조기 가치 실현과 리스크 방지를 동시에 달성했습니다.

사람 관리자에서 에이전트 관리자로 전환해야 합니다. 단순 작업자(L1)를 줄이는 데 그치지 않고, 중간 관리자(L2)의 역할을 ‘팀원 평가’에서 ‘프롬프트 평가 및 에이전트 피드백 루프 관리’로 전환했습니다. 직무의 본질을 바꾸지 않고 기술만 얹는 도입은 작동하지 않는다는 것을 보여줍니다.

복제 조건과 한계. 이 모델이 작동하려면 최소 수십 명 규모의 내부 시스템 엔지니어링 역량, Retool 등 내부 툴 플랫폼 구축 경험, 그리고 명문화된 표준 업무 절차서(SOP)가 사전에 준비되어 있어야 합니다. 명확한 SOP가 없는 상태에서는 프롬프트 엔지니어링으로 해결할 수 있는 영역이 극히 제한적입니다.


6. 원문에 없는 추정 (구현 가설)

6.1 Retool 에이전트 플랫폼과 MCP 오케스트레이션 파이프라인

근거: 원문은 시스템 엔지니어링 팀이 2023년 3월부터 OpenAI 개발자 플랫폼을 모방한 Retool 기반 플랫폼을 구축했고, 내·외부 동일한 MCP(Model Context Protocol) 도구를 공유하며 API 연동 워크플로를 제공한다고 명시합니다.

실제 플랫폼 내부에서는 운영자가 Retool UI에서 프롬프트를 작성하고 모델(OpenAI, Anthropic 등)을 지정하면, 백엔드의 MCP 클라이언트가 금융 코어 시스템의 읽기 전용 API(계좌 잔액 조회, 결제 승인 내역, 거래처 정보) 및 외부 검색 툴과 결합되는 구조였을 가능성이 높습니다. 운영자가 버튼을 클릭해 테스트를 실행하면 동일한 입력 데이터 세트에 대해 여러 모델의 출력과 토큰 소요 시간, 비용이 비교 표로 렌더링되고, 사전에 정의된 평가 기준(Eval rubric)에 따라 일치 여부가 채점되는 파이프라인이 Retool 상단에 구현되었을 것입니다. 배포 단계에서는 검증된 프롬프트와 도구 조합이 고유한 에이전트 엔드포인트 ID로 발행되어, Slack 봇이나 웹훅 기반 내부 배치 작업에서 직접 호출할 수 있도록 구성되었을 것으로 추정됩니다.

6.2 100% AI 전수 QA 에이전트의 피드백 루프

근거: 원문은 5명의 수동 QA 담당자가 1명으로 줄고, 에이전트가 고객 응대 전체(100%)를 사내 품질 기준표에 따라 실시간으로 검수하며, 매니저는 에이전트 코칭에 집중한다고 밝힙니다.

이를 프로덕션 환경으로 옮기면, 매일 수천 건 발생하는 고객 상담 로그가 종료되는 즉시 이벤트 버스를 통해 비동기 QA 평가 워크플로로 전달되었을 것입니다. QA 에이전트는 대화 전문을 수신하여 상담원의 공감도, 금융 규정 준수 여부, 안내의 정확성, 해결 완료 여부 등을 항목별(예: 1~5점)로 채점하고 판정 사유를 생성합니다. 기준 점수 미달이나 규정 위반 플래그가 발생한 티켓은 즉시 L2 매니저 전용 예외 대시보드로 격리됩니다. 매니저는 이 대시보드에서 문제 사례의 군집(클러스터링)을 확인하고, 이것이 상담원의 안내 실수인지 에이전트 프롬프트의 지침 부족인지를 판별하여 시스템 프롬프트 업데이트나 개별 코칭으로 즉각 연결하는 폐쇄 루프가 작동했을 가능성이 큽니다.

6.3 분쟁 처리 에이전트의 규칙 파싱 및 증빙 생성 엔진

근거: 원문은 Kyle Martin이 100페이지 분량의 분쟁 규칙서와 BPO SOP를 입력하여 3시간 걸리던 처리를 3초로 줄였고, 마스터카드 규정에서 2~3개의 추가 논점을 찾아내 더 강력한 분쟁 제기 서류를 만들었다고 설명합니다.

이 워크플로는 단일 프롬프트가 아니라 단계별 체인으로 구성되었을 개연성이 높습니다. 첫 단계에서는 분쟁 사유(부정 거래, 상품 미수령, 금액 상이 등)와 거래 메타데이터를 파싱하여 관련 마스터카드 규칙 장(chapter)을 벡터 검색 또는 인덱스 기반으로 추출합니다. 두 번째 단계에서는 고객이 제출한 소명 내용과 판매자의 거래 영수증 데이터를 규정 조항의 요건과 대조하여 승소 가능성이 높은 조항들을 매칭합니다. 세 번째 단계에서는 매칭된 규칙 번호와 인용 문구를 구조화된 분쟁 서식 양식에 맞추어 법적 설득력을 갖춘 공식 문서로 렌더링하고, 승인 시스템 API로 전송하는 방식으로 3초 내 종단 처리를 완성했을 것입니다.


7. 출처

  1. First Round Applied Intelligence — Agent + Human Ops: How AI is Changing Roles and Workflows at Brex
    https://www.firstround.com/ai/brex
    발행일: 2025-09-25
    (CTO James Reggio, COO Camilla Matias 인터뷰; 에이전트 플랫폼, L1/L2/L3 구조, 분쟁 3초, 100% AI QA, 4단계 AI Fluency)