AI

Devin SWE-2가 핫한 이유, 성능보다 더 중요한 건 비용이었다

Cognition의 새 코딩 모델 SWE-2는 상위권 성능과 낮은 실행 비용을 동시에 노립니다. 벤치마크 강점과 한계, 실제 사용 가능 범위를 함께 봤습니다.

SWE-2는 정확히 무엇인가

SWE-2는 Devin을 만드는 Cognition이 2026년 9월 10일 공개한 소프트웨어 엔지니어링 특화 모델입니다. 기반 모델은 Moonshot AI의 Kimi K3이고, Cognition이 에이전트형 코딩 작업에 맞춰 추가 강화학습을 적용했습니다.

이번 모델의 핵심은 단순히 더 높은 정답률을 노리는 데 있지 않습니다. Cognition은 추론 단계별로 비용 페널티를 적용해, 같은 문제를 해결하더라도 불필요하게 오래 탐색하거나 많은 계산을 쓰지 않도록 학습했다고 설명합니다.

벤치마크 숫자는 꽤 강하다

벤치마크SWE-2Kimi K3Fable 5.1GPT-5.6 SolGPT-6 Astra
FrontierCode 1.1 Main50.0%44.2%50.9%47.5%53.3%
DeepSWE 1.173.0%68.5%67.4%72.7%74.1%
Terminal-Bench 2.192.8%88.3%91.4%88.8%89.9%
Terminal-Bench 427.3%21.5%55.8%37.3%57.9%

FrontierCode 1.1 Main에서 SWE-2는 50.0%를 기록해 Fable 5.1의 50.9%와 가까웠고, DeepSWE 1.1에서는 73.0%로 GPT-5.6 Sol의 72.7%와 비슷한 수준이었습니다. Terminal-Bench 2.1에서도 92.8%로 높은 점수를 냈습니다.

다만 이 표를 모델 전체의 절대적인 우열표로 읽으면 안 됩니다. FrontierCode는 Cognition이 직접 만든 평가이고, 각 벤치마크는 실행 환경과 에이전트 하네스의 영향을 받습니다.

Terminal-Bench 4에서는 약점도 보인다

특히 Terminal-Bench 4 결과는 눈에 띕니다. SWE-2는 27.3%로, 같은 표의 Fable 5.1 55.8%와 GPT-6 Astra 57.9%보다 크게 낮았습니다.

이 수치 하나만으로 특정 벤치마크에 과적합됐다고 단정할 수는 없습니다. 버전이 다른 Terminal-Bench는 난이도와 과제 구성이 달라 단순한 전후 비교가 어렵기 때문입니다. 그래도 최신·고난도 에이전트 작업에서도 항상 최상위 모델과 비슷하다고 보기는 어렵다는 신호로는 충분합니다.

사람들이 주목하는 이유는 비용이다

Cognition은 FrontierCode 1.1 Main에서 SWE-2가 Fable 5.1과 거의 비슷한 결과를 내면서 비용은 64% 낮았다고 주장합니다. GPT-6 Astra와 비교해서도 여러 평가에서 비슷한 영역까지 접근하면서 약 4분의 1 수준 비용이라고 설명합니다.

이 수치는 Cognition의 자체 측정치라 독립 검증과 구분해서 봐야 합니다. 하지만 코딩 에이전트에서는 비용 문제가 실제 사용성에 바로 연결됩니다. 파일을 찾고, 코드를 읽고, 수정하고, 테스트하고, 실패 원인을 찾는 과정을 반복하기 때문에 같은 성능이라면 더 적은 단계와 더 낮은 비용이 큰 차이를 만듭니다.

SWE-1.7보다 덜 헤맨다

Cognition의 공개 자료에서 SWE-1.7은 첫 코드 수정을 하기까지 중앙값 48단계가 필요했지만 SWE-2 Medium은 18단계로 줄었습니다. 평균 작업 단계도 SWE-1.7의 127단계에서 SWE-2 Medium의 53단계로 감소했습니다.

Cognition은 SWE-2 Medium이 SWE-1.7보다 높은 점수를 기록하면서도 작업 단계는 58% 적고 평균 비용은 81% 낮았다고 설명합니다. 단순히 모델을 작게 만드는 대신, 어디를 읽고 언제 실제 수정에 들어갈지를 더 효율적으로 판단하도록 만든 셈입니다.

지금 바로 쓸 수 있나

가능합니다. 다만 일반적인 독립 API 모델처럼 아무 에이전트에 붙이는 방식은 아닙니다.

9월 10일 공개 시점 기준 SWE-2는 Devin Desktop과 Devin CLI에서 사용할 수 있고, Devin Web과 Fusion에도 순차 적용되고 있습니다. 즉 현재는 Devin 생태계 안에서 사용하는 모델에 가깝습니다.

9월 11일 Cognition이 공개한 Fusion에서는 Fable 5.1 같은 상위 모델을 계획과 검토에 두고 SWE-2를 실행용 사이드킥으로 조합하는 방식을 권장하기도 했습니다. 이 흐름 역시 SWE-2의 포지션이 '무조건 최고 성능'보다 '상당한 성능을 더 싸게 쓰는 모델'에 가깝다는 점을 보여줍니다.

그래서 무엇이 달라졌나

SWE-2를 단순히 새로운 최강 코딩 AI라고 부르기는 어렵습니다. Terminal-Bench 4에서는 약점이 뚜렷하고, 핵심 비용 수치도 아직 Cognition의 자체 측정치라는 한계가 있습니다.

그래도 방향은 분명합니다. 코딩 에이전트 경쟁이 이제는 최고 점수 하나보다, 실제 작업을 얼마나 적은 단계와 낮은 비용으로 끝내느냐까지 포함하는 경쟁으로 넓어지고 있습니다.

SWE-2가 지금 주목받는 이유는 50.0%라는 숫자 하나가 아니라, 상위권 코딩 성능을 유지하면서도 계산과 탐색 비용을 줄이려는 접근을 모델 학습 단계부터 밀어붙였다는 데 있습니다. 앞으로 볼 것은 독립 평가에서도 이 비용 효율이 유지되는지, 그리고 대규모 실제 코드베이스에서도 Terminal-Bench 4에서 보인 약점이 얼마나 드러나는지입니다.

출처

확인한 자료

01Introducing SWE-2: Pushing the Pareto Frontierhttps://cognition.com/blog/swe-202FrontierCode Leaderboardhttps://cognition.com/frontiercode03Introducing Fusion in Devin Desktop & CLIhttps://cognition.com/blog/local-fusion

글 검색