Jev 열풍 뒤 등장한 Laya, 정말 ‘오픈소스 Jev’일까
Laya는 수십 ms 로컬 결정 모델로 흥미롭지만, ‘Jev보다 정확하다’는 0.766 수치는 해당 업무에 파인튜닝한 specialist 결과입니다. 기본 모델의 제로샷·한국어·고카디널리티 한계까지 함께 봤습니다.
Jev가 나온 지 나흘 만에 Laya 패키지가 공개됐다
TypeSafe는 2026년 9월 15일 첫 System One 모델 Jev를 공개했습니다. 텍스트를 토큰 단위로 생성하는 대신 미리 정한 타입의 결정을 병렬로 내놓는 모델입니다. TypeSafe가 제시한 응답 시간은 70~500ms, 입력 가격은 100만 토큰당 0.042달러입니다. TypeSafe 발표
그리고 9월 19일 PyPI에 Laya가 올라왔습니다. 현재 공개 패키지는 Apache 2.0 라이선스이며 모델 가중치도 공개돼 직접 실행할 수 있습니다. PyPI laya
겉으로 보면 Jev의 오픈소스 대체재가 나흘 만에 등장한 셈입니다. 하지만 구조와 벤치마크를 따라가면 “무료 Jev”라고 부르기에는 중요한 차이가 있습니다.
Laya는 글을 쓰지 않고 세 종류의 판단만 한다
Laya가 받는 질문은 크게 choice, score, noul 세 종류입니다.
| 타입 | 출력 | 예시 |
|---|---|---|
choice | 후보 중 하나와 각 후보 확률 | billing / sales / support |
score | 순서가 있는 단계별 분포와 기대값 | 긴급도 낮음~매우 높음 |
noul | 참일 확률 P(true) | 해지 의사가 있는가? |
일반 LLM처럼 문장을 만든 뒤 JSON을 파싱하는 방식이 아닙니다. 상태와 질문, 선택지를 함께 넣으면 한 번의 forward pass에서 정해진 형태의 확률을 반환합니다. 그래서 생성 토큰도, 스트리밍도, 생성된 JSON의 문법 오류를 처리하는 코드도 없습니다. Laya README
다만 “텍스트를 생성하지 않으니 틀리지 않는다”는 뜻은 아닙니다. 출력 형식이 깨질 위험은 줄지만, 분류와 확률 자체는 충분히 틀릴 수 있습니다. 특히 Laya 공개 자료에서도 언어·선택지 수·도메인에 따라 정확도와 calibration 차이가 크게 나타납니다.
421M 모델이 한 번에 결정한다
영어 기본 모델은 ModernBERT-large 기반 약 4억2100만 파라미터, 다국어 모델은 mmBERT-base 기반 약 3억2200만 파라미터입니다. typed-decisions 업무에 별도로 파인튜닝한 421M 체크포인트도 따로 공개돼 있습니다.
기본 context는 영어 모델 512 token, 다국어와 typed-decisions 모델 1024 token입니다. LLM의 긴 대화 기록을 그대로 먹이는 모델이라기보다, 애플리케이션이 필요한 상태를 짧게 정리해 넘겨주는 decision layer에 가깝습니다. Laya typed-decisions 모델 카드
속도는 실제로 인상적이다
Laya 프로젝트가 Tesla T4에서 공개한 측정치는 영어 모델 1문항 39.5ms, 다국어 모델 32.8ms입니다. 10문항을 한 번에 처리하면 다국어 모델은 전체 72.3ms, 문항당 약 7.2ms였습니다. Laya 벤치마크
다만 이 수치를 Jev와 직접 나란히 놓고 “몇 배 빠르다”고 단정하면 조건이 달라집니다. Laya 저장소도 Jev 수치는 외부 공개 측정값을 가져왔고 같은 하드웨어·같은 네트워크에서 직접 A/B 테스트한 것이 아니라고 적고 있습니다.
대신 로컬 실행이라는 장점은 분명합니다. Node.js·TypeScript용 ONNX 구현은 Python이나 PyTorch 없이 실행되며, Apple Silicon용 독립 Core ML 포트는 M3 Max에서 짧은 다국어 결정 하나를 약 4.98ms p50으로 측정했습니다. 두 포트 모두 원 Laya 프로젝트와 별개의 커뮤니티 구현입니다. ONNX 포트 · Core ML 포트
가장 조심해서 봐야 할 숫자, 0.766 대 0.727
Laya를 소개하는 글에서 가장 눈에 띄는 숫자는 typed-decisions 벤치마크의 정확도입니다.
| 모델 | 종류 | 정확도 |
|---|---|---|
| Laya typed-decisions | 해당 업무 train split으로 파인튜닝한 specialist | 0.766 |
| Jev 1.13.0 | 별도 학습 없이 실행한 generalist | 0.727 |
| 문항별 majority baseline | 기준선 | 0.461 |
| Laya 기본 영어 모델 | 파인튜닝하지 않은 base | 0.361 |
| Laya 다국어 기본 모델 | 파인튜닝하지 않은 base | 0.342 |
핵심은 첫 두 줄의 조건이 다르다는 점입니다. 0.766은 typed-decisions 훈련 데이터로 별도 학습한 Laya specialist입니다. Jev 1.13.0의 0.727은 이 벤치마크에 따로 맞춰 학습하지 않은 generalist 측정입니다.
더 중요한 것은 Laya 기본 모델입니다. 영어 0.361, 다국어 0.342로 문항별 majority baseline 0.461보다 낮았습니다. Laya 저장소도 이 결과를 근거로 “이 벤치마크에서의 능력은 파인튜닝에서 나온다”고 명시합니다. Laya BENCHMARKS.md
벤치마크 원 데이터셋의 설명은 더 직접적입니다. specialist 숫자와 generalist 숫자를 종류 표시 없이 나란히 두면 독자를 오도할 수 있다고 경고합니다. Jev 1.13.0은 2026년 9월 18일 TypeSafe API로 400개 사례, 2000개 결정을 실제 측정한 값으로 기록돼 있습니다. LocalLLaMA typed-decisions
0.766이 ‘더 잘 이해한다’는 뜻도 아니다
typed-decisions 데이터의 teacher self-agreement는 0.735입니다. 파인튜닝 Laya는 0.766으로 이 값을 넘습니다.
겉으로는 더 좋아 보이지만 데이터셋 설명은 이 구간을 조심해서 해석합니다. teacher agreement를 크게 넘는 모델은 실제 시나리오 이해가 좋아졌다기보다 라벨 생성 과정의 특성이나 잡음을 더 잘 학습했을 가능성이 있다는 것입니다.
따라서 이 숫자 하나로 “Laya가 Jev보다 똑똑하다”라고 결론 내리기는 어렵습니다. 오히려 특정 업무 데이터가 있을 때 작은 모델을 얼마나 강하게 전문화할 수 있는가를 보여주는 수치로 읽는 편이 정확합니다.
한국어는 다국어 모델을 써야 하지만 영어만큼 강하지 않다
Laya는 100개가 넘는 언어를 지원하는 다국어 체크포인트를 공개했습니다. 하지만 “지원”과 “동일한 정확도”는 다릅니다.
20개 intent 선택지를 사용하는 MASSIVE 테스트에서 한국어 정확도는 영어 전용 Laya가 0.110, 다국어 Laya가 0.450이었습니다. 무작위 선택은 0.050입니다. 다국어 모델이 훨씬 낫지만 영어 MASSIVE의 0.783과는 차이가 큽니다. 51개 언어 결과
더 위험한 부분은 영어 모델이 다른 언어에서 자신 있게 틀릴 수 있다는 점입니다. 그래서 Laya에는 스크립트와 언어를 보고 영어·다국어·특화 체크포인트를 고르는 Router가 들어가 있습니다.
선택지가 많아지면 약점이 드러난다
Banking77처럼 선택지가 수십 개로 늘어나는 분류에서는 Laya 공개 결과가 0.425, Jev 공개 수치가 0.870으로 크게 벌어졌습니다. Laya 쪽 설명에 따르면 기본 설정에서 질문 헤더에 쓸 수 있는 token budget을 77개 후보가 나눠 가지면서 각 라벨 설명 공간이 지나치게 짧아지는 문제가 있습니다.
Laya는 50개 이상 후보를 다룰 때 head_max_len과 전체 context를 키우거나, 먼저 큰 범주를 고른 뒤 세부 후보를 고르는 2단계 구조를 권합니다. 반면 TypeSafe는 Jev가 최대 255개 cardinality를 지원한다고 밝히고 있습니다. Jev 공식 설명
이 차이는 “분류 모델은 무조건 작고 빠르면 된다”는 접근에도 한계가 있다는 뜻입니다. 후보 자체가 길고 많아지면 후보의 의미를 충분히 표현하는 능력이 중요해집니다.
확률을 반환한다고 해서 바로 믿을 수 있는 것도 아니다
decision model에서 정확도만큼 중요한 것이 calibration입니다. confidence 0.9인 사례가 실제로도 약 90% 맞아야 자동화 조건으로 사용할 수 있습니다.
하지만 Laya의 공개 측정에서 기본 영어 모델의 ECE는 출고 상태 0.466, 다국어 모델은 0.314였습니다. 둘 다 과신하는 경향이 있었고, 별도 held-out 데이터로 temperature를 다시 맞춘 뒤 각각 0.081, 0.106까지 내려갔습니다. Calibration 결과
즉 프로덕션에서 confidence > 0.9 같은 규칙을 붙이기 전에 자신의 도메인 데이터로 threshold와 calibration을 검증해야 합니다. 모델이 90%라고 말하는 것과 실제 정답률 90%는 별개입니다.
그렇다면 Laya는 Jev가 나온 뒤 급조된 복제품일까
이 부분도 단순하게 결론 내리기 어렵습니다. 현재의 Laya 패키지는 Jev 공개 뒤인 9월 19일 PyPI에 올라왔습니다. 하지만 개발자 Nandakishor M은 그보다 전부터 생성보다 확률 기반 판단에 집중하는 연구를 공개했습니다.
2025년 3월의 SalesRLAgent 논문은 영업 대화에서 구매 전환 확률을 실시간으로 예측하는 강화학습 모델을 제안했습니다. 논문은 85ms 추론을 보고했고, GPT-4o로 만든 synthetic data와 Azure OpenAI embedding을 사용했습니다. SalesRLAgent
따라서 “생성보다 빠른 확률 결정에 집중했다”는 연구 방향이 Jev보다 앞섰다는 점은 확인됩니다. 다만 그 연구는 현재 Laya의 ModernBERT 기반 choice·score·noul 범용 구조와 동일하지 않습니다.
또 2025년 9월의 두 번째 공개 논문은 Confidence-Aware Routing for Large Language Model Reliability Enhancement입니다. 로컬 생성, RAG, 큰 모델, 사람 검토 중 어디로 보낼지를 사전 신뢰도로 결정하는 연구이지 현재 Laya와 같은 typed-decision 모델 논문은 아닙니다. Confidence-Aware Routing
현재 자료가 허용하는 표현은 이 정도입니다. 아이디어의 선행 연구는 확인되지만, 지금의 Laya가 Jev보다 1년 먼저 완성돼 있었다고 볼 근거는 부족합니다.
실제로 어디에 쓰면 Laya가 매력적일까
Laya가 가장 잘 맞아 보이는 곳은 AI 에이전트의 작은 결정들입니다. 어떤 도구를 호출할지, 고객 문의를 어느 팀으로 보낼지, 사람 검토가 필요한지, 입력이 위험한지처럼 짧은 판단을 반복하는 경우입니다.
특히 같은 결정을 대량으로 반복하고, 자체 학습 데이터를 확보할 수 있으며, 외부 API로 데이터를 보내기 어렵고, 모델 파인튜닝과 calibration까지 운영할 수 있는 서비스라면 Laya의 장점이 커집니다.
반대로 처음 보는 문제를 별도 학습 없이 바로 처리해야 하거나, 수십~수백 개 후보를 한 번에 비교하거나, 긴 문맥을 읽어야 한다면 현재 공개 결과만으로 Laya를 Jev의 완전한 대체재로 보기는 어렵습니다.
그래서, Laya에서 봐야 할 것은 ‘Jev를 이겼다’가 아니다
Laya는 지금 상당히 흥미로운 프로젝트입니다. 오픈 가중치이고, 로컬에서 수십 ms 또는 그보다 빠르게 실행할 수 있으며, 며칠 사이 ONNX와 Core ML 같은 포트까지 생겼습니다.
하지만 가장 화제가 된 0.766은 specialist 숫자이고, 같은 벤치마크의 기본 Laya는 majority baseline 아래였습니다. 한국어와 많은 선택지, calibration에도 분명한 조건이 있습니다.
오히려 Laya가 보여주는 변화는 다른 곳에 있습니다. 지금까지는 분류 하나, 라우팅 하나에도 큰 생성형 LLM을 호출하는 것이 자연스러웠습니다. Jev와 Laya가 동시에 던지는 질문은 더 단순합니다.
“이 판단에 정말 텍스트 생성이 필요한가?”
그 답이 ‘아니다’인 업무가 많다면 앞으로 에이전트 구조는 큰 LLM 하나가 모든 것을 판단하는 방식에서, 작은 decision model이 수많은 짧은 결정을 처리하고 복잡한 경우만 큰 모델로 넘기는 쪽으로 바뀔 수 있습니다. 현재 Laya의 가치는 Jev를 누가 이겼느냐보다, 그 구조를 누구나 직접 실험할 수 있게 만들었다는 데 더 가깝습니다.