AI 에이전트가 웹 브라우저를 제어할 때 긴 텍스트를 생성하던 방식은 높은 비용과 속도 지연을 야기했다. TypeSafe AI가 공개한 Jev 모델은 텍스트 생성 대신 정형화된 확률적 결정을 내리는 방식으로 웹 자동화 성능을 크게 끌어올렸다. 브라우저 프로토콜 호출 수를 대폭 줄이고 저렴한 비용으로 빠르게 작업을 수행하는 Jev의 주요 특징과 개발자 연동 포인트를 살펴본다.

텍스트 생성을 멈춘 AI 에이전트 브라우저

Jev는 TypeSafe AI가 선보인 System One 의사결정 모델로, 기존 대형 언어 모델과 달리 텍스트를 생성하는 대신 정형화된 확률적 결정을 내린다. 브라우저 자동화 과정에서 클릭, 입력, 스크롤, 대기 등의 미세한 액션을 신속하게 선택하도록 설계되었다. 기존 LLM이 단일 클릭을 결정하는 데 길고 복잡한 텍스트를 생성해야 했던 것과 달리, Jev는 70밀리초에서 500밀리초 수준의 빠른 반응 속도로 동작 결정을 전달한다. 최저 92밀리초 수준의 평가 시간을 기록하기도 하는 이 방식은 의사결정 지연을 줄이고 웹 에이전트의 구동 방식을 텍스트 기반 제어에서 정형적 결정 구조로 전환시킨다.

브라우저 프로토콜 호출과 작업 시간 감소

Jev 도입 전후의 지표를 비교해 보면 웹 에이전트의 구동 효율이 크게 개선되었음을 확인할 수 있다. 기존 방식과 비교할 때 중간값 기준 브라우저 프로토콜 호출 수가 1092회에서 101회로 대폭 줄었다. 이는 불필요하고 세부적인 브라우저 상호작용을 크게 감소시킨 결과다. 작업 완료 시간 역시 중간값 기준 9.450초에서 7.092초로 떨어지며 약 25퍼센트의 시간 단축을 달성했다. 예를 들어 위키피디아 문서를 여는 작업도 2.798초 만에 완료하는 등 웹 프로토콜 호출 최소화와 작업 시간 단축이 직접적인 연관을 맺고 있다.

이 도표는 Jev 도입 전후의 브라우저 프로토콜 호출 수와 작업 완료 시간 감소를 비교한다.

실제 웹 검색 데모와 비용 구조

실제 구글 플라이트 검색 데모에서는 스위스 취리히에서 런던까지의 항공권 검색 작업을 단 7.1초 만에 마쳤다. 이 과정에는 페이지 로드까지 포함되어 있었으며, 총소요 비용은 0.0039달러에 불과했다. 가격 모델 측면에서도 Jev는 뛰어난 경제성을 갖추고 있다. 입력 토큰은 백만 개당 0.042달러 수준이며 출력 토큰은 비용이 발생하지 않는다. 무료 출력 토큰 구조와 저렴한 입력 비용은 대규모 웹 자동화 스크립트를 상시 구동하는 개발자에게 커다란 비용절감 효과를 제공한다.

이 도표는 스위스 취리히에서 런던까지의 구글 플라이트 검색 데모에서 나타난 소요 시간과 비용을 보여준다.

백그라운드 멀티태스킹과 안전한 작업 제어

Jev 브라우저는 Playwright를 활용해 Chromium 기반의 헤드리스 브라우저를 구동하여 작동한다. 에이전트는 독립된 공간에서 실행되기 때문에 사용자가 메인 브라우저를 사용하는 동안에도 마우스 제어나 탭 전환을 방해하지 않고 백그라운드 멀티태스킹을 수행한다. 또한 작업을 진행하면서 목표 달성 여부나 진행 차단 상태를 명확히 판별한다. 완료 상태인 DONE과 차단 상태인 BLOCKED를 정확히 파악하여 무한 루프에 빠지지 않도록 돕고 에이전트 구동의 안정성을 대폭 향상시킨다.

개발자를 위한 Jev 연동 요약

Jev는 빠른 의사결정 속도와 저렴한 실행 비용으로 기존 AI 에이전트의 웹 자동화 한계를 극복한다. 개발 환경 측면에서는 Node.js 20 이상의 환경에서 MIT 라이선스로 자유롭게 활용할 수 있다. 구동 시 상태 및 질문 토큰 예산은 약 32000토큰으로 한정되며 이는 영문 150000자 분량에 해당한다. 백그라운드 멀티태스킹과 정형화된 액션 결정 모델을 결합하면 안정적이고 속도가 빠른 웹 에이전트를 구축할 수 있다. 반복적인 브라우저 제어 작업을 자동화하려는 개발자에게 Jev 연동은 실질적인 대안이 된다.


참고