본문으로 이동geul

SWE-2는 얼마나 쓸 만할까? Fable, Sol, Astra 성능과 비용 비교

geul조회 1
  • Cognition의 SWE-2는 코딩 성능과 작업 비용을 함께 개선하는 데 초점을 맞춘 모델

  • 일부 코딩 평가에서 Fable 5.1, GPT-5.6 Sol에 근접하거나 높은 점수를 기록하지만, 모든 작업에서 상위 모델을 대체하는 수준은 아님

  • Fable, Astra가 계획과 검토를 맡고 SWE-2가 구현을 나누는 Fusion 구성도 제공

  • 2026년 9월 22일 공식 자료 확인 기준이며 직접 사용한 후기는 아님

SWE-2가 관심을 받는 이유

  • AI 코딩 비용은 토큰 가격뿐 아니라 탐색, 수정, 테스트를 얼마나 반복하는지에 따라 달라짐

  • Cognition은 SWE-2 학습에서 작업 성공과 비용을 함께 고려했다고 설명

  • 자체 FrontierCode 평가에서 SWE-2 medium은 이전 SWE-1.7보다 높은 점수를 얻으면서 평균 작업 단계를 127회에서 53회로 줄임

  • 처음 코드를 수정하기까지 걸린 단계의 중앙값도 48회에서 18회로 감소

  • 필요한 부분을 빨리 찾아 구현하는 방향의 개선이며, 단계 감소가 그대로 실행 시간 단축을 뜻하지는 않음

Fable, Sol, Astra와 비교하면

Cognition이 공개한 평가 결과임. 모델별 실행 도구가 다르고 추론 설정 중 최고 점수를 사용하므로, 동일 환경의 독립적인 종합 순위는 아님.

코드 변경의 품질 / FrontierCode 1.1 Main

코드의 정답 여부뿐 아니라 테스트, 수정 범위, 스타일 등 실제 반영 가능한 변경인지 평가.

모델

점수

SWE-2

50.0%

Fable 5.1

50.9%

GPT-5.6 Sol

47.5%

GPT-6 Astra

53.3%

  • SWE-2는 Fable 5.1과 0.9%포인트 차이

  • Sol보다 높은 점수를 기록했으며 Astra보다는 낮음

코딩 작업 수행 / DeepSWE 1.1

모델

점수

SWE-2

73.0%

Fable 5.1

67.4%

GPT-5.6 Sol

72.7%

GPT-6 Astra

74.1%

  • SWE-2는 Sol과 비슷하고 Astra에 가까운 결과

  • 이 평가에서는 Fable 5.1보다 높은 점수를 기록

터미널 작업 수행 / Terminal-Bench 4

모델

점수

SWE-2

27.3%

Fable 5.1

55.8%

GPT-5.6 Sol

37.3%

GPT-6 Astra

57.9%

  • 이 평가에서는 SWE-2와 상위 모델 사이에 큰 격차가 나타남

  • 일부 코딩 평가에서 근접했다는 이유만으로 Fable, Astra를 완전히 대체한다고 보기는 어려움

비용은 얼마나 드나

100만 토큰당 달러 기준. SWE-2는 Devin 문서의 정가, 나머지는 공급사의 표준 API 가격임.

모델

입력 / 출력

SWE-2

$3 / $15

GPT-5.6 Sol

$4 / $20

Fable 5.1

$10 / $50

GPT-6 Astra

$10 / $50

  • 입력, 출력 정가만 비교하면 SWE-2는 Sol보다 25%, Fable, Astra보다 70% 저렴

  • 실제 비용은 캐시 사용량, 추론 토큰, 재시도, 긴 입력 할증 등에 따라 달라짐

  • SWE-2 가격은 Devin 내 사용량 계산 기준이며, 별도의 공개 추론 API 제공 여부를 뜻하지 않음

이미 처리한 문맥을 재사용하는 캐시 읽기 가격은 별도로 봐야 함.

모델

캐시 읽기 / 100만 토큰

SWE-2

$0.30

GPT-5.6 Sol

$0.40

Fable 5.1

$0.25

GPT-6 Astra

$1.00

  • Fable 5.1은 캐시 읽기 가격이 SWE-2보다 낮음

  • 반복해서 읽는 문맥이 많은 작업에서는 입력, 출력 단가만 비교했을 때와 다른 결과가 나올 수 있음

월 20달러와 SWE-2 무료 사용은 별개

Devin 개인 요금제

월 구독료

Pro

$20

Max

$200

  • 구독료는 Devin 서비스와 포함 사용량에 대한 비용이며 SWE-2의 토큰 정가와 구분해야 함

  • 모델 문서는 셀프서비스 플랜에서 SWE-2를 2026년 10월 15일까지 무료로 제공하고 이후 정가를 적용한다고 안내

  • 다만 가격 페이지에는 10월 10일까지로 표시돼 공식 페이지 사이에 차이가 있음

  • 이용 전 계정의 모델 선택 화면에서 적용 기간과 조건을 확인할 필요가 있음

  • 무료 모델은 쿼터를 차감하지 않지만 동시 실행이나 처리 속도까지 제한이 없다는 의미는 아님

Fable, Astra와 함께 쓰는 Fusion

Cognition이 공개한 Fusion 모델 선택 화면.

  • Fusion은 주 모델과 보조 모델이 각자의 문맥을 유지하며 작업을 나누는 방식

  • Fable, Astra가 계획, 모호한 요구사항의 해석, 결과 검토를 담당

  • SWE-2는 위임받은 코드 탐색, 구현, 테스트 등을 수행하고 결과를 보고

  • 주 모델은 결과를 검토하고 필요하면 수정을 요청하거나 직접 작업을 맡음

Cognition이 공개한 DeepSWE 1.1 결과는 다음과 같음. 앞의 SWE-2 발표 표와는 평가 구성이 달라 점수를 직접 이어 비교하면 안 됨.

Fable 5.1과 SWE-2 조합

비교 항목

단독 사용 / Fusion

평가 점수

64.3 / 63.1

작업당 비용

$14.63 / $7.88

비용 감소

약 46%

Astra와 SWE-2 조합

비교 항목

단독 사용 / Fusion

평가 점수

67.6 / 67.3

작업당 비용

$7.88 / $4.69

비용 감소

약 40%

  • 두 조합 모두 비용과 함께 점수도 조금 낮아짐

  • 성능 손실이 전혀 없다고 표현할 수는 없지만, 비용을 줄이는 활용 방향을 보여줌

  • SWE-2 단독 성능과 여러 모델을 조합한 결과는 구분해야 함

어떤 용도로 검토할 만한가

  • 요구사항과 완료 조건이 분명한 기능 구현, 버그 수정, 테스트 작업에서 비용을 비교해볼 후보

  • 설계와 검토에 상위 모델을 유지하고 싶다면 Fusion 조합도 검토 가능

  • 선택 기준은 토큰 단가보다 같은 작업을 끝내는 데 든 총비용, 소요 시간, 재작업 횟수가 적절함

  • 자신의 저장소에서도 같은 성과가 나올지는 대표 작업 몇 개로 직접 비교할 필요가 있음

참고 자료

좋아요저장

댓글

로그인후 댓글을 남길 수 있습니다.

아직 댓글이 없습니다.