Jev가 선보인 새로운 형태의 LLM: System One, 일명 의사결정 모델

TMT

https://simonwillison.net/2026/Sep/21/jev/

지난주 TypeSafe AI가 ‘System One 모델’이라는 새로운 모델 유형의 첫 사례로 Jev를 공개했습니다. 저는 Maggie Appleton의 의견에 동의합니다. 이런 모델은 ‘의사결정 모델’이라고 부르는 편이 더 낫다고 생각합니다. Jev는 일반적인 LLM 형식을 흥미롭게 변형한 모델입니다. 텍스트를 입력받는다는 점은 같지만, 텍스트를 출력하는 대신 범주, 예/아니요 질문, 평점, 그리고 이에 수반되는 신뢰도 점수에 해당하는 부동소수점 수를 반환합니다.

TypeSafe는 Jev를 이렇게 설명합니다.

Jev를 최첨단 AI의 지능을 활용하는 함수 호출이라고 생각해 보세요. 비정형 상태를 입력하면, 타입이 지정된 확률적 판단을 출력합니다.

속도도 매우 빠르고, 정말 저렴합니다. 일반적인 LLM은 입력 토큰과 출력 토큰을 기준으로 요금이 책정되며, 대체로 출력 토큰의 요금이 훨씬 높습니다. Jev는 입력에만 요금을 부과하고 출력은 무료입니다. 첫 모델의 입력 가격은 100만 토큰당 0.042달러로, OpenAI의 GPT-5 Nano(100만 토큰당 0.05달러)보다도 저렴합니다.

Jev에는 텍스트나 반정형 데이터에 관해 질문할 수 있습니다. 문자열, 문자열 배열 또는 이름-값 쌍의 집합을 담은 ‘상태(state)’ 객체를 구성합니다. 기사나 고객, 그 밖의 어떤 종류의 레코드든 이 객체로 표현할 수 있습니다. 그런 다음 하나 이상의 질문과 함께 API로 보내면 각 질문에 대한 답을 받습니다.

질문은 세 가지 유형으로 나뉩니다.

  • 예/아니요 질문. Jev에서는 이를 ‘Noul’ 질문이라고 부릅니다. TypeSafe의 CEO는 이 이름이 베르누이 분포의 Bernoulli를 줄인 말이라고 Hacker News에서 확인해 주었습니다. 어떤 진술을 제시하면, 모델이 그 진술을 참이라고 얼마나 확신하는지 나타내는 0과 1 사이의 부동소수점 수를 돌려받습니다.
  • 선택형 질문. 모델이 주어진 선택지 중 하나를 고릅니다. 정확히는 신뢰도 점수와 함께 모든 선택지에 대한 확률 분포를 반환합니다.
  • 점수형 질문. 설명이 붙은 숫자 단계를 순서대로 제시하면, 해당 범위 안의 부동소수점 점수를 반환합니다.

Jev API에는 문서 하나(‘상태’)와 함께 컨텍스트 윈도에 들어갈 수 있는 만큼의 질문을 보낼 수 있습니다. 질문들은 병렬로 평가하므로, 여러 질문을 보내더라도 질문 하나를 보낼 때와 비슷한 시간이 걸릴 것입니다.

저는 의사결정 모델이라는 관점이 Jev를 어디에 활용할지 이해하는 데 도움이 된다고 생각합니다. 스팸 탐지, 라벨 추천, 우선순위 지정, 순위 매기기처럼 분류 작업으로 표현할 수 있는 일에 적합합니다.

저는 검색 결과의 순위를 다시 매기는 용도로도 실험하고 있습니다. BM25처럼 비용이 적게 드는 알고리즘으로 일치할 가능성이 높은 결과 100개를 가져온 뒤, Jev가 원래 검색어와의 관련성을 기준으로 이 후보 100개에 점수를 매기도록 하는 방식입니다.

블랙박스가 다시 유행하고 있습니다

Jev에서 조금 불편하게 느낀 점은, 머신러닝 시스템이 한층 더 깊은 블랙박스로 되돌아가는 모습을 보여 준다는 것입니다.

LLM도 이미 블랙박스입니다. 판단의 근거를 설명해 달라고 요청할 수는 있지만, 그 설명이 유용하거나 정확하다는 보장은 없습니다.

Jev는 그마저도 제공하지 않습니다. 텍스트를 아무리 많이 입력해도 돌아오는 것은 부동소수점 수뿐입니다. Jev가 어떤 내용을 스팸으로 분류했다면, 그 내용의 어떤 단서가 그런 판단을 이끌었을까요?

따라서 편향에 대한 우려도 가장 중요하게 다뤄야 합니다. 아무도 Jev로 입사 지원자의 순위를 매기지 않기를 진심으로 바랍니다. 그 부동소수점 수에는 모델에 내재된 온갖 보이지 않는 편향이 숨어 있을 수 있고, 실험을 통해 그 편향을 하나씩 밝혀내기는 까다로울 것입니다.

(저는 샌프란시스코 베이 에어리어의 모든 도시를 대상으로 ‘좋은 도시인가?’라는 예/아니요 질문을 던지고 Jev가 점수를 매기게 해 봤습니다. 쿠퍼티노가 가장 높은 점수를, 이스트팔로알토가 가장 낮은 점수를 받았습니다. 흠.)

실무적으로 보면, 일반적인 LLM 프로젝트보다 평가와 체계적인 실험이 더욱 중요하다는 뜻입니다. 다행히 Jev는 매우 저렴해서 실험용 프롬프트를 수백 개, 심지어 수천 개 실행해도 비용이 몇 센트에 불과합니다.

Jev의 색다른 활용법

지난 며칠 동안 여러 커뮤니티에서 Jev의 활용 가능성을 제안하는 모습을 지켜보는 일이 무척 재미있었습니다. 그중 눈길을 끈 창의적인 사례 몇 가지를 소개합니다.

  • Kyle Pena의 jevchat은 Jev를 (형편없는) 채팅 모델로 바꿉니다. “매 단계에서 Jev에 질문 하나를 던집니다. 사용자의 질문과 지금까지 작성한 답변을 고려할 때, 다음에 올 기호는 무엇인가요?” Hacker News의 ericpruitt는 이렇게 표현했습니다. “모티가 죽음의 수정을 보면서 말하는 모습을 디지털로 옮겨 놓은 셈이네요.”
  • Fatih Kadir Akın의 jev-leftpad는 “targetLength에 도달하려면 value 앞에 공백이 몇 개 필요한가요?”라는 프롬프트와, “공백 0개가 필요합니다”부터 “공백 10개가 필요합니다”까지 선택할 수 있는 선택형 쿼리left-pad를 구현합니다.
  • Andy Gayton의 jev-2048은 Jev로 2048 슬라이딩 퍼즐 게임을 플레이합니다.

가중치 공개 모델로 재현하기

가중치가 공개된 모델을 기반으로 Jev와 같은 모델을 만들려는 프로젝트도 잇따라 등장했습니다. 흥미로운 사례 중 하나인 Kev는 Qwen 3.5를 활용해 파라미터가 8억 개, 40억 개, 90억 개인 모델을 만듭니다. 관련 Hacker News 토론에서는 누군가 ‘Jev 계열 의사결정 모델’을 비교하는 벤치마크인 JevBench의 링크를 공유했습니다. 벌써 이런 벤치마크까지 등장한 것입니다.

Jev가 출시된 지 아직 일주일도 채 지나지 않았다는 점을 생각하면, 이를 둘러싼 활동의 규모가 무척 인상적입니다.

Edit this page

Search the archive

Find a page by title, or search the text inside one.