키워드3분 읽기Noventis

Jev와 '시스템 1' 모델: LLM에게 결정을 맡기지 말고 판정만 받아라

2026년 9월 TypeSafe AI가 공개한 Jev는 텍스트가 아니라 타입이 정해진 값과 보정된 확률만 돌려주는 결정 모델입니다. 왜 이런 모델이 필요해졌는지, 검증되지 않은 주장은 무엇인지, AX 에이전트에서 코드가 제어 흐름을 소유하게 만드는 방법을 노벤티스의 적용 방식으로 설명합니다.

문서 트레이가 들어가면 예/아니오 토글, 루브릭 다이얼, 선택 스위치가 보정 확률 계기와 함께 나오고, 우회 레인은 사람 검토 책상으로 이어지는 결정 스위치보드.
문서 트레이가 들어가면 예/아니오 토글, 루브릭 다이얼, 선택 스위치가 보정 확률 계기와 함께 나오고, 우회 레인은 사람 검토 책상으로 이어지는 결정 스위치보드.

2026년 9월 15일, 샌프란시스코의 TypeSafe AI가 4,000만 달러 시드 투자와 함께 첫 모델 Jev를 공개했습니다. 챗 모델처럼 토큰을 하나씩 생성하지 않고, 상태(이메일, 로그, 티켓, JSON)와 타입이 정해진 질문 목록을 받아 '보기 중 선택', '루브릭 점수', '예/아니오'를 각각 보정된 확률과 함께 한 번에 돌려줍니다. 카너먼의 '빠른 사고'에서 이름을 따 '시스템 1 모델'이라 부릅니다. 발표 수치는 지연 70~500ms, 입력 100만 토큰당 0.042달러(출력 무료), 컨텍스트 64K입니다.

왜 결정 모델이 필요해졌나

범용 LLM에 '이 문서를 보고 알아서 처리해'라고 맡기면 데모는 인상적이지만 운영에서는 결과가 매번 조금씩 다르고, 왜 그렇게 판단했는지 구조적으로 남지 않습니다. 결정 모델은 그 반대를 지향합니다. 정해진 스키마로만 답하고, 확률이 실제 정답률과 맞도록(발표 자료의 RLCD) 훈련합니다. 90%라고 답한 것들은 실제로 90% 정도 맞아야 한다는 뜻입니다. 이 성질이 있어야 '확신이 낮으면 사람에게'라는 라우팅이 성립합니다.

아직 검증되지 않은 것

독립 리뷰들은 벤치마크가 자체 채점이고, 아키텍처와 가중치가 비공개이며, 대기 명단 방식의 초기 접근이고, 32K 텍스트 전용 상태 예산이 실제 업무의 상당수를 배제한다고 지적합니다. '환각이 수학적으로 불가능하다'는 문구는 '스키마 밖 값을 내지 않는다'로 읽어야지 '틀리지 않는다'로 읽으면 안 됩니다. 노벤티스는 이런 모델을 쓸 때 공급자의 속도·가격 주장을 실측으로 간주하지 않고, 우리 데이터로 다시 잽니다.

노벤티스가 적용하는 규칙

  • 코드가 제어 흐름을 소유한다. 다음에 무엇을 할지는 코드가 정하고, 모델은 분기에 필요한 판정 값만 준다.
  • 의미 검증만 묻는다. '이 답변이 브랜드를 언급했는가', '이 권고가 근거와 모순되는가'처럼 사람이 읽어야 아는 것만 모델에게 묻고, 형식 검사는 코드로 한다.
  • 신뢰도 기반 라우팅. 문턱 아래는 자동 처리하지 않고 사람 검토 큐로 보낸다. 모델 응답이 계약과 다르거나 호출이 실패하면 보류(HOLD)로 남기고 지표에 승격하지 않는다.
  • 비용 통제도 하네스다. 요청당 항목 수와 글자 수 상한, 조직별 호출 제한, 같은 입력에 대한 캐시를 코드에 둔다.

노벤티스는 AI 답변 모니터링 제품에서 브랜드 언급·추천 여부·긍정/부정 판정에 결정 모델을 '보조 검수'로 씁니다. 언급 위치나 출처 유형처럼 규칙으로 확인 가능한 것은 코드가 판정하고, 의미가 필요한 것만 모델에 묻습니다. 고객사 업무 자동화에서도 같습니다. 견적 요청 분류, 문의 라우팅, 콘텐츠 검수처럼 '판정'이 필요한 지점만 결정 모델에 맡기고 나머지는 코드로 고정합니다. AX에서 신뢰는 모델의 똑똑함이 아니라 판정이 구조화돼 있는지에서 나옵니다.

이제, 다음 단계로나아가세요.

어떤 일이 반복되는지 알려주세요.
사람이 더 중요한 일에 집중할 방법을 함께 찾겠습니다.

프로젝트 문의하기