SWE-2는 얼마나 쓸 만할까? Fable, Sol, Astra 성능과 비용 비교
Cognition의 SWE-2는 코딩 성능과 작업 비용을 함께 개선하는 데 초점을 맞춘 모델
일부 코딩 평가에서 Fable 5.1, GPT-5.6 Sol에 근접하거나 높은 점수를 기록하지만, 모든 작업에서 상위 모델을 대체하는 수준은 아님
Fable, Astra가 계획과 검토를 맡고 SWE-2가 구현을 나누는 Fusion 구성도 제공
2026년 9월 22일 공식 자료 확인 기준이며 직접 사용한 후기는 아님
SWE-2가 관심을 받는 이유
AI 코딩 비용은 토큰 가격뿐 아니라 탐색, 수정, 테스트를 얼마나 반복하는지에 따라 달라짐
Cognition은 SWE-2 학습에서 작업 성공과 비용을 함께 고려했다고 설명
자체 FrontierCode 평가에서 SWE-2 medium은 이전 SWE-1.7보다 높은 점수를 얻으면서 평균 작업 단계를 127회에서 53회로 줄임
처음 코드를 수정하기까지 걸린 단계의 중앙값도 48회에서 18회로 감소
필요한 부분을 빨리 찾아 구현하는 방향의 개선이며, 단계 감소가 그대로 실행 시간 단축을 뜻하지는 않음
Fable, Sol, Astra와 비교하면
Cognition이 공개한 평가 결과임. 모델별 실행 도구가 다르고 추론 설정 중 최고 점수를 사용하므로, 동일 환경의 독립적인 종합 순위는 아님.
코드 변경의 품질 / FrontierCode 1.1 Main
코드의 정답 여부뿐 아니라 테스트, 수정 범위, 스타일 등 실제 반영 가능한 변경인지 평가.
모델 | 점수 |
|---|---|
SWE-2 | 50.0% |
Fable 5.1 | 50.9% |
GPT-5.6 Sol | 47.5% |
GPT-6 Astra | 53.3% |
SWE-2는 Fable 5.1과 0.9%포인트 차이
Sol보다 높은 점수를 기록했으며 Astra보다는 낮음
코딩 작업 수행 / DeepSWE 1.1
모델 | 점수 |
|---|---|
SWE-2 | 73.0% |
Fable 5.1 | 67.4% |
GPT-5.6 Sol | 72.7% |
GPT-6 Astra | 74.1% |
SWE-2는 Sol과 비슷하고 Astra에 가까운 결과
이 평가에서는 Fable 5.1보다 높은 점수를 기록
터미널 작업 수행 / Terminal-Bench 4
모델 | 점수 |
|---|---|
SWE-2 | 27.3% |
Fable 5.1 | 55.8% |
GPT-5.6 Sol | 37.3% |
GPT-6 Astra | 57.9% |
이 평가에서는 SWE-2와 상위 모델 사이에 큰 격차가 나타남
일부 코딩 평가에서 근접했다는 이유만으로 Fable, Astra를 완전히 대체한다고 보기는 어려움
비용은 얼마나 드나
100만 토큰당 달러 기준. SWE-2는 Devin 문서의 정가, 나머지는 공급사의 표준 API 가격임.
모델 | 입력 / 출력 |
|---|---|
SWE-2 | $3 / $15 |
GPT-5.6 Sol | $4 / $20 |
Fable 5.1 | $10 / $50 |
GPT-6 Astra | $10 / $50 |
입력, 출력 정가만 비교하면 SWE-2는 Sol보다 25%, Fable, Astra보다 70% 저렴
실제 비용은 캐시 사용량, 추론 토큰, 재시도, 긴 입력 할증 등에 따라 달라짐
SWE-2 가격은 Devin 내 사용량 계산 기준이며, 별도의 공개 추론 API 제공 여부를 뜻하지 않음
이미 처리한 문맥을 재사용하는 캐시 읽기 가격은 별도로 봐야 함.
모델 | 캐시 읽기 / 100만 토큰 |
|---|---|
SWE-2 | $0.30 |
GPT-5.6 Sol | $0.40 |
Fable 5.1 | $0.25 |
GPT-6 Astra | $1.00 |
Fable 5.1은 캐시 읽기 가격이 SWE-2보다 낮음
반복해서 읽는 문맥이 많은 작업에서는 입력, 출력 단가만 비교했을 때와 다른 결과가 나올 수 있음
월 20달러와 SWE-2 무료 사용은 별개
Devin 개인 요금제 | 월 구독료 |
|---|---|
Pro | $20 |
Max | $200 |
구독료는 Devin 서비스와 포함 사용량에 대한 비용이며 SWE-2의 토큰 정가와 구분해야 함
모델 문서는 셀프서비스 플랜에서 SWE-2를 2026년 10월 15일까지 무료로 제공하고 이후 정가를 적용한다고 안내
다만 가격 페이지에는 10월 10일까지로 표시돼 공식 페이지 사이에 차이가 있음
이용 전 계정의 모델 선택 화면에서 적용 기간과 조건을 확인할 필요가 있음
무료 모델은 쿼터를 차감하지 않지만 동시 실행이나 처리 속도까지 제한이 없다는 의미는 아님
Fable, Astra와 함께 쓰는 Fusion
Cognition이 공개한 Fusion 모델 선택 화면.
Fusion은 주 모델과 보조 모델이 각자의 문맥을 유지하며 작업을 나누는 방식
Fable, Astra가 계획, 모호한 요구사항의 해석, 결과 검토를 담당
SWE-2는 위임받은 코드 탐색, 구현, 테스트 등을 수행하고 결과를 보고
주 모델은 결과를 검토하고 필요하면 수정을 요청하거나 직접 작업을 맡음
Cognition이 공개한 DeepSWE 1.1 결과는 다음과 같음. 앞의 SWE-2 발표 표와는 평가 구성이 달라 점수를 직접 이어 비교하면 안 됨.
Fable 5.1과 SWE-2 조합
비교 항목 | 단독 사용 / Fusion |
|---|---|
평가 점수 | 64.3 / 63.1 |
작업당 비용 | $14.63 / $7.88 |
비용 감소 | 약 46% |
Astra와 SWE-2 조합
비교 항목 | 단독 사용 / Fusion |
|---|---|
평가 점수 | 67.6 / 67.3 |
작업당 비용 | $7.88 / $4.69 |
비용 감소 | 약 40% |
두 조합 모두 비용과 함께 점수도 조금 낮아짐
성능 손실이 전혀 없다고 표현할 수는 없지만, 비용을 줄이는 활용 방향을 보여줌
SWE-2 단독 성능과 여러 모델을 조합한 결과는 구분해야 함
어떤 용도로 검토할 만한가
요구사항과 완료 조건이 분명한 기능 구현, 버그 수정, 테스트 작업에서 비용을 비교해볼 후보
설계와 검토에 상위 모델을 유지하고 싶다면 Fusion 조합도 검토 가능
선택 기준은 토큰 단가보다 같은 작업을 끝내는 데 든 총비용, 소요 시간, 재작업 횟수가 적절함
자신의 저장소에서도 같은 성과가 나올지는 대표 작업 몇 개로 직접 비교할 필요가 있음