코딩 모델에 터미널을 주어 브라우저와 데스크톱 작업을 자동화하는 방법
웹사이트에서 정보를 수집하거나 데스크톱 앱에서 설정을 변경하는 반복적인 작업을 모델이 스스로 코드를 작성해 처리하게 됩니다. 기존 방식이 매번 화면 상태를 보고 다음 클릭을 예측하던 것과 달리, 이 도구는 모델이 터미널에서 스크립트를 작성하고 실행하며 결과를 확인하는 흐름을 따릅니다. 브라우저 세션이 아닌 로컬 워크스페이스의 코드와 로그가 핵심 상태가 되어, 복잡한 다단계 작업을 더 안정적으로 수행할 수 있게 됩니다.
브라우저와 데스크톱 통합
2026년 10월 3일, 프로젝트는 Webwright에서 CUAWright로 이름을 바꾸며 브라우저 자동화뿐 아니라 Ubuntu 가상 머신 내 데스크톱 작업 지원까지 통합했습니다. 기존 webwright 명령어와 Python 임포트는 그대로 작동하지만, 브라우저 작업은 cuawright web, 데스크톱 작업은 cuawright desktop 명령으로 구분해 실행합니다. 이번 업데이트로 OSWorld-V2 벤치마크 재현이 가능해졌으며, 브라우저 런타임은 cuawright.webwright 경로로 이동했습니다. 이러한 구조 변경은 디지털 에이전트 인터페이스를 최소화하고 통합하려는 방향성을 반영합니다.
코드로 브라우저와 데스크톱 조종
이 도구는 코딩 모델에 터미널을 제공하여 브라우저나 데스크톱 애플리케이션을 직접 조작하게 합니다. 모델은 Playwright 스크립트를 작성해 요소를 조회하고 조건을 기다리며, 지연 로딩이나 재렌더링 같은 동적 동작을 처리합니다. 생성된 스크립트는 재실행하거나 다른 작업에 맞게 수정해 재사용할 수 있어, 매번 처음부터 탐색하는 비효율을 줄입니다. 데스크톱 작업의 경우 OSWorld-V2 Ubuntu VM에서 터미널을 통해 애플리케이션을 검사하고 명령을 실행하며, 스크린샷을 확인해 작업을 완료합니다.
벤치마크 성능과 비용
동일한 모델을 다른 하네스에서 실행한 결과와 비교했을 때, CUAWright는 모든 벤치마크에서 더 높은 점수를 기록했습니다. OSWorld-V2에서는 GPT-5.6 Sol을 사용해 67.9%의 부분 점수를 얻었으며, 이는 모델 단독 실행보다 5.2%p 높은 수치입니다. CAD 작업에서는 BenchCAD 평균 IoU 79.0%, CADGenBench 종합 점수 55.7%를 기록했습니다. 특히 OSWorld-V2에서 GPT-5.6 Sol 사용 시 작업당 API 비용을 9.5달러 절감하면서도 점수를 높이는 결과를 보였습니다.
스크립트를 스킬로 변환
Skill Factory는 선택적 확장 기능으로, 해결 과정에서 생성된 스크립트를 검증된 매개변수화 코드로 정제해 라이브러리에 저장합니다. 학습된 스킬은 모델 없이 독립적으로 약 40초 만에 실행되며 토큰 비용이 0입니다. WebArena 벤치마크에서 이 재사용 기능을 적용하면 홀드아웃 정확도가 55%에서 70%로 15%p 상승했습니다. 에이전트 루프에 변경 없이 플러그인 방식으로 작동하며, 새 작업 시작 전 라이브러리를 확인해 매칭되는 스킬을 직접 실행하거나 프롬프트에 힌트로 주입합니다.
실행 전 확인 사항
브라우저 작업은 Python 3.10 이상, Playwright를 통한 Chromium 설치, 그리고 OpenAI, Anthropic, 또는 OpenRouter 중 하나의 API 키가 필요합니다. 데스크톱 작업은 Python 3.12 이상, Responses 호환 모델 API 키, Docker, 그리고 Hugging Face에서 접근 권한을 받아야 하는 공식 태스크 및 자산 스냅샷 접근이 필수입니다. 설치 시 pip install -e .과 playwright install chromium을 실행하며, 데스크톱 기능은 pip install -e ".[desktop]"으로 추가 설치합니다. API 키는 소스, 태스크, 자산, 결과 디렉터리 밖의 사용자 소유 파일에 0600 권한으로 저장해야 하며, 기존 webwright 명령어는 하위 호환성을 유지하지만 신규 기능은 cuawright 명령을 사용해야 합니다.