소비자용 AI 에이전트 전용 브라우저는 사라진다
Jev + stagehand 를 보면서 드는 생각이. 누구나 컴퓨터 제어와 브라우저 제어를 쉽게 할 수 있게 된다면, AI 에이전트 전용 브라우저를 개발하는 접근이 과연 살아남을수 있을까? 오히려 소비자는 더 브라우저를 사용하지 않는 Meta Muse같은 UI가 사라지는 접근을 사용할거고. 사실상 이게 일종의 내장 브라우저를 가진 에이전트 전용 브라우저이고. 브라우저로 AI가 하는게 뭔지 보겠다는 접근이 필요한 곳은 그냥 위의 라이브러리를 사용해서 자체 통합 데스크탑앱을 만드는게 좋아보이는데?
1. 지능형 웹 자동화 기술의 진화: Jev와 Stagehand 기반 경량 파이프라인
웹 브라우저 자동화 기술은 거대한 원시 DOM(Document Object Model) 전체를 컨텍스트 윈도우에 주입하거나 고해상도 뷰포트 스크린샷을 Vision-Language Model(VLM)에 반복적으로 입력하던 다중 모달(Multimodal) 방식에서 급격한 전환점을 맞이하고 있다. 초기 비전 기반 에이전트 아키텍처는 비정형 텍스트 생성과 자유 좌표(Coordinate) 예측에 수 초에서 수십 초의 지연 시간을 소모하였으며, 단일 워크플로 실행 시 수 센트에서 수 달러에 이르는 토큰 비용을 발생시켜 상용화의 병목으로 작용하였다.
이러한 비효율을 해결하기 위해 등장한 구조가 TypeSafe AI의 시스템 1(System One) 의사결정 모델인 Jev와 Browserbase의 Stagehand v4 라이브러리가 결합된 분리형 파이프라인이다. 이 아키텍처는 브라우저 내부 상태 지각(Perception), 의사결정(Decision), 실제 조작 실행(Execution)의 단계를 철저히 모듈화하여 단일 태스크 실행 비용을 $0.001 수준으로 낮추고 반응 속도를 수 밀리초 단위로 단축시켰다.
| 계층 구분 | 핵심 기술 스택 | 데이터 입출력 규격 | 성능 및 아키텍처 특성 |
| 지각 계층 (Perception) | Stagehand v4 Hybrid Pruner | Chrome Accessibility Tree (AXNode), 편평화된 XPath 매핑 | 렌더링 트리의 시각·스타일 노이즈를 제거하고 대화형 제어 요소를 정규화된 식별자( |
| 판단 계층 (Decision) | TypeSafe AI Jev (System 1) | 정형 열거형(Bounded Enum), 확률 분포, 신뢰도 점수 | 255개 이하의 유한 선택지 중 최적 액션을 밀리초 단위로 결정하며 비정형 텍스트 생성을 배제 |
| 실행 계층 (Execution) | Stagehand Extension / Native CDP | Chrome DevTools Protocol, DOM Mutation 이벤트 | 브라우저 내부에 상주하는 익스텐션 런타임에서 저지연 직접 디스패치 및 크로스 프레임(OOPIF) 조작 수행 |
| 자가 치유 및 캐시 | Server-side Action Cache | 정규화된 자연어 목표·DOM 상태 해시 | 성공한 실행 경로를 서버에 캐싱하여 추론 비용 0으로 재실행하며, 요소 변경 시 자가 치유(Self-healing) 작동 |
접근성 트리(Accessibility Tree)를 통한 상태 추상화
Stagehand는 크롬 개발자 도구 프로토콜(CDP)의 Accessibility.getFullAXTree 명령어를 호출하여 렌더링 엔진 내부의 접근성 트리 구조를 직접 추출한다. 웹 페이지의 원시 HTML 소스는 에이전트의 결정에 불필요한 인라인 스타일, 복잡한 CSS 클래스, 스크립트 블록을 다수 포함하고 있어 컨텍스트 윈도우를 불필요하게 낭비한다. 반면 스크린 리더와 보조 공학 기기를 위해 브라우저가 사전 컴파일하는 접근성 트리는 버튼, 텍스트 입력 상자, 체크박스 등 실제 상호작용 가능한 노드(AXNode)와 그 시맨틱 역할(Role), 이름(Name), 상태(State)만을 간결하게 보존한다.
Stagehand는 추출된 접근성 노드에 고유 번호([N])를 부여하고 이를 실제 DOM의 절대 XPath와 연결하는 룩업 테이블을 메모리에 구축한다. 특히 상용 웹 애플리케이션에서 빈번하게 발생하는 동일 출처 및 교차 출처 iframe(Out-of-Process iFrames, OOPIF)과 섀도우 DOM(Shadow DOM) 구조를 깊이 우선 탐색(DFS)으로 순회하여 프레임 서수와 노드 식별자가 결합된 전역 고유 EncodedId를 생성한다. 이러한 전처리 과정을 통해 페이지 계층 구조를 단일 트리로 편평화(Flattening)함으로써 기존 원시 DOM 파싱 방식 대비 토큰 사용량을 80% 이상 절감한다.
의사결정 모델과 실행 엔진의 구조적 분리
Jev는 일반적인 자유 서술형 대형 언어 모델(Chat LLM)과 근본적으로 궤를 달리한다. 긴 문장을 생성하는 대신, 입력된 증거와 관찰 상태를 바탕으로 사전에 정의된 최대 255개의 후보군 중에서 가장 적합한 항목을 선택하고 그에 대한 확률 점수를 반환하는 경량 결정 엔진이다. Stagehand가 전달한 접근성 트리와 번호 매겨진 제어 요소들을 수신한 Jev는 클릭, 입력 필드 포커스, 스크롤 등 단일 액션과 목표 노드 인덱스를 즉각 결정한다. 텍스트 필드에 구체적인 문자열을 입력해야 하는 특수한 상황(TYPE_TEXT)에만 소형 텍스트 생성 모델을 보조적으로 호출함으로써 전체 지연 시간을 극소화한다.
이러한 접근 방식은 토큰당 $0.042/1M(백만 토큰당 4.2센트) 수준의 초저비용 구조를 실현시키며, 브라우저 프로세스 바로 옆에 네이티브 익스텐션 형태로 상주하는 Stagehand v4의 런타임 최적화와 결합하여 네트워크 왕복 지연 시간(RTT)을 완전히 상쇄한다.