Jev 사용사례 7가지: X 댓글 필터부터 브라우저 자동화까지
TypeSafe의 Jev를 활용해 브라우저 조작, 콘텐츠 필터링, 개발 업무 분류 등을 구현한 프로젝트가 공개되고 있음
공통점은 Jev가 선택, 분류, 점수 판단을 맡고 실제 동작은 프로그램이 수행한다는 것
공개 코드와 제작자 설명을 정리한 글이며 직접 실행한 후기는 아님. 초기 프로젝트와 데모가 많아 속도와 비용 수치를 일반화하기는 어려움
X 댓글에서 불필요한 내용 걸러내기 / BlueNoise
X의 댓글을 흐리게 표시하거나 접고 숨기는 브라우저 확장 프로그램
키워드와 계정 규칙으로 걸러지지 않은 댓글에 Jev를 적용해 불필요한 내용인지 추가 판단
제작자 설명에 따르면 잡음일 확률을 90% 이상으로 판단한 댓글에 사용자가 정한 표시 방식을 적용
Jev 기능은 실험 단계로 기본 비활성화이며 개인 TypeSafe API 키가 필요함
규칙을 통과한 댓글 텍스트가 외부 API로 전송되므로 로컬 필터 기능과 구분해야 함
유튜브 협찬 구간 건너뛰기 / jev-skip
제작자 공개 데모. 판단 응답은 기록된 결과를 재생한 화면이며 새 영상 분석에는 실제 API 호출이 필요함.
영상 자막을 Jev에 전달해 구간별 협찬 가능성을 판단하는 확장 프로그램
다른 시청자가 협찬 구간을 등록하기 전에도 분석할 수 있도록 설계
판단 결과를 재생 막대에 표시하고 선택한 구간을 건너뛰는 방식
영상이나 음성을 직접 이해하는 기능은 아니며 자막이 없으면 분석하지 않음
브라우저에서 항공편 검색하기 / Jev Ultrafast
Browser Use가 공개한 항공편 검색 데모. 제작자 측정 기록이며 일반적인 작업 속도를 보장하는 수치는 아님.
Browser Use가 공개한 브라우저 에이전트
화면에서 관찰한 버튼과 입력칸을 선택지로 만들고 Jev가 다음 동작과 대상을 고름
문장 입력이 필요할 때만 별도 소형 LLM을 사용
제작자는 Google Flights에서 취리히에서 런던으로 가는 항공편을 찾는 7.1초 데모를 공개
측정은 최초 화면 관찰 이후 시작하며 특정 조건의 검색 기록임. 항공권 선택이나 예약, 결제까지 완료한 사례는 아님
안드로이드 앱 조작하기 / Mobile Jev
제작자 공개 화면. Uber에서 경로를 입력하고 결제 선택 화면까지 이동하는 데모이며 차량 호출 완료를 보여주는 것은 아님.
실제 안드로이드 기기의 앱과 화면 요소를 관찰하고 Jev가 다음 조작을 선택
기기 조작은 Mobilerun API가 수행하며 실행 과정과 소요 시간을 확인할 수 있음
Uber에서 출발지와 목적지를 입력하고 결제 선택 화면까지 이동하는 데모 공개
기록상 약 21초 동안 9회 동작을 수행
안드로이드 설정에서 다크 모드를 켜고 실제 상태를 확인하는 예제도 포함
자연어 규칙으로 채팅 검토하기 / Openroom
채팅 메시지가 방에 표시되기 전에 Jev가 규칙 위반 여부를 판단
금칙어 목록 대신 자연어로 작성한 방 규칙을 사용
제작자 설명에 따르면 규칙 문장을 바꾸면 메시지를 다시 평가하고 불확실한 메시지는 사람이 검토하도록 보류
Jev, Convex, Vercel을 결합한 공개 데모로 실제 운영 규모와 검토 정확도는 확인되지 않음
개발 작업에 맞는 모델 선택하기 / Jev Codex Router
작업 내용을 Jev로 분류해 Codex가 사용할 모델과 추론 강도를 선택하는 프로젝트
간단한 작업과 복잡한 작업에 서로 다른 모델을 배정하려는 접근
모델 선택 기준과 예외 처리는 코드에 두고 판단 기록을 남김
소개된 약 60% 절감은 이전 정책으로 237개 턴을 재현한 시뮬레이션 결과
실제 Codex 사용량 절감이나 현재 정책의 효과를 입증하는 수치는 아님
개발 티켓의 난이도와 반복 실패 판단하기 / trau
개발 자동화 서비스 trau는 Jev를 업무 주변의 작은 판단에 적용했다고 설명
티켓 하나에 난이도, 여러 모듈에 걸친 변경인지, 검증하기 어려운 작업인지 등을 함께 질문
결과를 모델 선택과 작업 준비 상태 안내에 활용
과거 실패에서 얻은 교훈이 현재 작업에 필요한지, 새 티켓이 기존 작업과 중복되는지도 판단
수정 후 같은 원인의 실패가 반복되는지 감지해 알림을 보내는 용도로도 사용
제작팀은 자체 데이터에 대한 정확도 벤치마크가 아직 없다고 명시
사례에서 드러나는 활용 방향
후보 중 고르기: 클릭할 버튼, 사용할 모델, 참고할 과거 기록 선택
내용 분류하기: 댓글의 잡음 여부, 협찬 구간, 채팅 규칙 위반 판단
작업 상태 평가하기: 난이도, 중복, 반복 실패 감지
글이나 코드를 생성하는 모델과 함께 사용하거나 기존 규칙만으로 처리하기 어려운 판단을 보완하는 형태가 많음
정해진 형식으로 답을 받는 것과 올바르게 판단하는 것은 별개이므로 사례별 정확도와 불확실한 결과의 처리 방식도 함께 살펴야 함