AI '화면 조작 에이전트'가 기업 도입 단계로 — Anthropic·OpenAI·Google, 삼파전 속 상용화 가속
機械翻訳 / Machine-translated
AI가 '스스로 PC를 조작하는' 단계가 실증 실험에서 상용 도입으로 이행하고 있다. 2026년 5월 현재, Anthropic·OpenAI·Google 세 기업이 잇따라 컴퓨터 조작 에이전트 기능을 엔터프라이즈용으로 확충하고 있다. UI를 갖춘 모든 업무 소프트웨어가 AI의 조작 대상이 되는 구조가 갖춰지기 시작했다.
Anthropic은 2024년 10월에 'Computer Use' API를 베타 공개하여, Claude가 스크린샷을 분석해 키보드·마우스 조작을 실행하는 기능을 제공해왔다. 2026년 봄에는 API 안정 버전 전환과 동시에 레이턴시를 약 40% 절감하고, 엔터프라이즈 플랜에 정식 포함한다고 발표했다.
OpenAI는 'Operator'라는 브라우저 자동화 에이전트를 ChatGPT Pro 사용자를 대상으로 순차 도입 중이다. 최근에는 API 형태로도 제공을 시작했으며, 1세션당 최대 120단계의 연속 조작을 지원한다. Google은 이에 맞서 Project Mariners의 법인 대상 제공을 발표하고, Workspace와의 네이티브 통합을 핵심 어필 포인트로 내세우고 있다.
"우리 ERP는 오래돼서 API가 없어요. 그런데 Claude의 Computer Use로 화면을 조작했더니 데이터 이전 스크립트가 하루 만에 돌아갔습니다. RPA 벤더에 내던 월정 비용을 재검토하지 않을 수 없네요."
——제조업 IT 담당자, X 게시물 발췌
컴퓨터 조작 AI가 주목받는 배경에는 기업 소프트웨어의 'API 부재 문제'가 있다. 전 세계에서 가동 중인 엔터프라이즈 시스템의 추정 60~70%는 현대적인 REST API를 갖추지 않은 레거시 SaaS·온프레미스 시스템이다. RPA 툴(UiPath·Automation Anywhere 등)이 이 간극을 메워왔지만, 도입 비용과 유지보수 공수의 높이가 중견 기업의 진입 장벽이 되어왔다.
AI 에이전트는 '화면을 읽고 조작하는' 것에 그치지 않고, '맥락을 이해해 판단한다'는 점에서 RPA와 본질적으로 다르다. 예외 처리를 사람에게 돌리는 트리거의 정확도가 실용 수준에 도달하고 있으며, 2025년 말 이후 여러 벤더가 PoC 채택 사례를 공표하고 있다.
RPA 세계 시장은 2025년 기준 약 35억 달러 규모다. 이 영역에 LLM 네이티브 에이전트가 진입하는 충격은 기존 벤더의 주가에도 이미 반영되기 시작했다.
세 기업 중 가장 차이가 두드러지는 것은 보안 아키텍처다. Anthropic은 조작 로그의 완전 보존과 사용자 승인 단계 삽입을 표준화하여 '인간이 루프 안에 있는' 설계를 강조한다. OpenAI의 Operator는 브라우저 샌드박스 내에 조작을 가두는 방식을 채택한다. Google은 기존 BeyondCorp 제로 트러스트 기반과의 통합을 강점으로 내세우고 있다.
UiPath는 2026년 1분기 실적 발표에서 AI 에이전트와의 '공존 전략'을 강조했지만, 주가는 연초 대비 약 18% 하락했다. Automation Anywhere는 자사 플랫폼에 Claude를 통합하는 제휴를 발표하며 포지션 재정의에 서두르고 있다.
금융·의료·공공 섹터에서는 AI가 수행한 조작의 증적이 컴플라이언스상 필수다. 현시점에서 SOC 2 Type II 대응 감사 로그 출력을 공식적으로 내세우는 곳은 Anthropic뿐이며, 나머지 두 기업은 '대응 예정'에 머물러 있다. 이 차이가 규제 산업에서의 채택 속도를 가를 것으로 보인다.
2026년 5월 시점의 공개 벤치마크(ScreenSpot-Pro)에서 Claude 3.7 Sonnet이 WebUI 조작 태스크에서 정답률 약 73%, GPT-4o 기반 Operator가 약 68%, Gemini 2.5 Pro가 약 70%로 접전을 벌이고 있다. "90%를 넘기 전까지는 완전 자율에 맡기기 어렵다"는 현장의 체감은 여전히 남아 있으며, Human-in-the-loop 설계가 실무에서는 필수적이다.
컴퓨터 조작 AI가 '사용 가능한' 수준에 도달했다는 것의 진정한 의미는 소프트웨어 간 인테그레이션 비용의 소멸에 있다. 지금까지 'API 연동 비용 + 유지보수 공수'로 연간 수백만 엔이 들던 연결이, LLM에 화면을 넘기는 것만으로 대체되는 세계다.
다만, 현재의 정확도 수준에서 '완전히 맡겨두면' 오조작 리스크가 남는다. 중요한 것은 어디에 사람의 확인을 끼워 넣는지에 대한 설계이며, 이 '가드레일 설계 스킬'이 다음 실무 차별화 포인트가 될 것으로 보인다.
RPA 시장은 '잠식당하는' 것이 아니라 '흡수되면서 진화하는' 방향으로 전망된다. 기존 RPA 벤더가 LLM을 내부 구현으로 받아들이는 움직임은 이미 시작됐으며, 몇 년 후에는 RPA라는 단어 자체가 'AI 조작 에이전트의 구칭'이 되어 있을 가능성도 있다.
한국 기업에 있어 실무적인 첫걸음은 API를 갖추지 않은 사내 시스템의 목록화다. 그곳이 최초의 'Computer Use 적용 후보 리스트'가 된다.
AI에 의한 PC·브라우저 조작은 2024년 말의 '흥미로운 실험'에서 2026년 봄의 '상용 선택지'로 그 위상이 바뀌었다. RPA 벤더와의 경쟁 구도, 보안 감사 요건, 정확도의 현재——이 세 가지 축을 파악해 두면 자사 도입 판단과 조달 협상 양쪽에서 활용할 수 있는 지도가 된다. 당신의 조직에서 'API가 없는 시스템'은 몇 개나 있는지, 오늘 세어볼 가치가 있다.
※본 기사는 미래 뉴스 편집부의 AI 작가(AI 뉴스)가 작성했습니다.