DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis

Hacker News · 2026.08.07

DeepSeek V4 Flash 0731, 실무에서 주목할 이유

2026년 7월 공개된 DeepSeek V4 Flash 0731은 오픈 웨이트(Open Weights) 모델로, 단순한 성능 수치를 넘어 비용 대비 효율성이라는 측면에서 백엔드 개발자들에게 실질적인 선택지가 될 수 있는 모델이다. Artificial Analysis Intelligence Index 기준 101개 모델 중 3위(점수 52)를 기록했으며, 중앙값(26)의 두 배에 달하는 수치다. 특히 코드 생성·리뷰, API 설계 보조, 문서 자동화 등 개발 워크플로우에 AI를 연동하는 경우라면 이 모델의 스펙은 더욱 구체적인 의미를 갖는다.

성능과 속도: 실용적인 수치들

속도 면에서는 101개 모델 중 10위로, 초당 약 106 토큰을 출력한다. 이는 동급 오픈 웨이트 모델 중 "notably fast" 등급에 해당하며, 대화형 인터페이스나 스트리밍 응답이 필요한 서비스에서 체감 지연을 줄이는 데 유리하다.

컨텍스트 윈도우는 1M 토큰으로, 대규모 코드베이스 전체나 긴 API 명세서를 한 번에 입력할 수 있다. 예를 들어 수천 줄짜리 Java 서비스 레이어를 통째로 넘기고 리팩터링 제안을 받는 시나리오가 현실적으로 가능해진다.

단, Verbosity(출력 토큰 수)가 101개 모델 중 29위로 상당히 높다. Intelligence Index 평가에서 생성된 토큰이 210M으로, 중앙값 99M의 두 배 이상이다. 이는 응답이 상세하다는 장점이 될 수도 있지만, 토큰 비용이 누적되는 프로덕션 환경에서는 프롬프트 설계로 출력 길이를 제어하는 전략이 필요하다.

// 출력 길이 제어 예시 (Spring AI 기준)
ChatOptions options = OpenAiChatOptions.builder()
    .withMaxTokens(512)          // 불필요한 장황함 방지
    .withTemperature(0.2f)
    .build();

가격 구조: 오픈 웨이트 모델의 경쟁력

비용 구조는 이 모델의 가장 강력한 셀링 포인트다.

  • 입력: $0.14 / 1M 토큰 (시장 중앙값 $0.43 대비 약 67% 저렴)
  • 출력: $0.28 / 1M 토큰 (시장 중앙값 $1.20 대비 약 77% 저렴)
  • 캐시 히트 가격: $0.003 / 1M 토큰으로 101개 모델 중 1위

캐시 히트 가격이 압도적으로 낮다는 점은 반복적인 시스템 프롬프트나 공통 컨텍스트를 재사용하는 패턴에서 극적인 비용 절감으로 이어진다. 예컨대 동일한 코딩 컨벤션 가이드나 도메인 용어 사전을 시스템 프롬프트에 고정해두고 여러 요청에 걸쳐 재사용하면, 실효 비용은 명목 단가보다 훨씬 낮아진다.

캐시 미사용: 1M tokens × $0.14 = $140
캐시 적용:   1M tokens × $0.003 = $3 (약 98% 절감)

Intelligence Index 전체 평가에 소요된 비용이 $72.03이라는 점을 감안하면, 동급 지능 수준의 상용 모델과 비교했을 때 운영 비용 차이가 상당하다.

정리

  • DeepSeek V4 Flash 0731은 Intelligence Index 3위(101개 중) 수준의 추론 능력을 입력 $0.14, 출력 $0.28 / 1M 토큰이라는 경쟁력 있는 가격에 제공한다.
  • 캐시 히트 가격($0.003)이 전체 1위로, 고정 컨텍스트를 반복 사용하는 워크플로우에서 비용 효율이 극대화된다.
  • 출력 장황함(Verbosity)이 높으므로 프로덕션 적용 시 maxTokens 등 출력 제어 옵션을 반드시 설정해 불필요한 토큰 낭비를 방지해야 한다.
Source
Hacker News
원문 보기 →
← 목록으로 돌아가기