
DeepSeek V4.1 Flash 대 DeepSeek V4 Pro: DeepSeek이 예정했다가 취소한 핸드오버
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
DeepSeek V4.1 Flash는 2026-09-10에 출시되었고, DeepSeek V4 Pro는 이제쯤이면 사라졌어야 했습니다. Flash 출시 이틀 전에 발표되고 출시일에 확정된 계획은, 2026-09-14 베이징 시간 12:00에 deepseek-v4-pro로 향하는 모든 요청을 더 새롭고 저렴한 deepseek-flash로 조용히 재라우팅하고 Flash 요금으로 청구한다는 계획이었습니다. DeepSeek은 개발자들이 반대하자 2026-09-11에 이를 취소했고, 2026-09-14에는 마감 시한이 지났는데도 V4 Pro는 여전히 서비스 중이었고 요금 청구도 그대로였습니다. 따라서 이것은 출시 비교가 아닙니다 — 왼쪽 모델은 출시된 지 8일 된 모델이고, 오른쪽 모델은 일반 제공 4개월 차에 접어든 1년 된 플래그십입니다. 이것은 제조사가 저렴한 쪽이 이겼다고 하는 벤치마크를 공개한 뒤, 사용자들이 동의하지 않는다는 것을 알게 되고 물러선 두 모델의 비교입니다. 그 일련의 과정은 이달에 두 모델 중 어느 쪽에 대해서든 누군가가 공개한 것 중 가장 유용한 내용입니다. 왜냐하면 그것이 바로 여러분이 곧 스스로 내리게 될 결정이기 때문입니다.
실제로 무슨 일이 일어났는지, 순서대로
여기서는 어떤 단일 벤치마크보다 타임라인이 더 중요합니다. 반전이 바로 이 이야기의 핵심이고, 그 발표는 의도적으로 조용히 이루어졌기 때문입니다.
• 2026-09-09 — DeepSeek는 사용자들에게 V4.1 Pro가 출시되기 전까지 V4 Pro 요청이 V4.1 Flash로 라우팅되며 Flash 요금으로 청구될 것이라고 알렸다. 핵심은 Flash가 성능, 비용, 속도, 작업 완료 시간 면에서 Pro를 전면적으로 앞질렀다는 것이다.
• 2026-09-10 — DeepSeek V4.1 Flash가 앱, 웹, API에서 정식 출시(GA)됩니다. 가중치는 MIT 라이선스로 Hugging Face에 공개됩니다. API 모델 이름은 deepseek-flash가 됩니다. 이전 세대인 deepseek-v4-flash 및 deepseek-v4-flash-vision-exp는 완전히 종료되며, 해당 레거시 ID는 일시적으로 V4.1 Flash로 라우팅됩니다. Pro 종료는 2026-09-14 베이징 시간 12:00(UTC 04:00)으로 연기됩니다.
• 2026-09-11 — DeepSeek, 방침을 번복하다. 사용자 요구에 대응해, V4 Pro API 서비스는 2026-09-14 이후에도 요금 변경 없이 계속 제공되며, V4.1 Flash로의 자동 전환은 취소된다고 밝혔다.
• 2026-09-14 — 마감일이 지나갑니다. V4 Pro는 오프피크 시간대에 백만 토큰당 $0.66 / $1.98로 여전히 제공되고 있습니다.
그 순서의 비대칭성이 바로 이 글의 핵심이다. Flash 사용자들은 원하든 원하지 않든 마이그레이션되었다 — 이전 V4 Flash ID는 이제 다른 모델로 응답한다. Pro 사용자들은 유예를 받았는데, 그 이유는 V4 Pro가 벤치마크를 더 잘하기 때문이 아니다. 그것은 프로덕션 시스템들이 V4 Pro에 맞춰 조정되어 있었기 때문이다: 프롬프트, 에이전트 스캐폴드, 평가 하네스, 그리고 호출자 측의 코드 변경 없이 백엔드 교체만으로 무효화되는 재현성 가정들. DeepSeek의 비교 페이지는 오늘날까지 두 모델을 나란히 함께 나열하고 있는데, 이는 회사가 두 모델 모두를 제공할 의도임을 알려준다.
나란히: 두 개의 SKU
아래의 모든 내용은 출처가 명시되지 않은 한 DeepSeek이 자체적으로 공개한 사양입니다. 가격은 100만 토큰당 비피크 요금이며, 괄호 안에 피크 요금이 표시됩니다. — DeepSeek의 피크 시간은 월요일부터 금요일까지 UTC 01:00~04:00과 다시 06:00~10:00이며, 그 외 모든 시간은 피크 요금의 절반인 비피크 시간입니다.
• API 모델 이름 — deepseek-flash (DeepSeek-V4.1-Flash) 대 deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• 입력, 캐시 미스 — $0.15($0.30) vs $0.66($1.32).
• 입력, 캐시 적중 — $0.003 ($0.006) vs $0.022 ($0.044).
• 출력 — $0.60 ($1.20) vs $1.98 ($3.96).
• 컨텍스트 / 최대 출력 — 둘 다 1M 토큰 / 384K. 동일.
• 이미지 입력 — Flash에서는 기본적으로 지원되며, V4 Pro에서는 지원되지 않는 것으로 표시됩니다.
• 동시성 한도 — Flash는 2,500, V4 Pro는 500입니다.
• 보고된 파라미터 — Flash: 총 552B, 벤더 측 수치이며, 이에 대해 신뢰할 만한 커뮤니티의 반론이 있습니다(자세한 내용은 아래에서 다룹니다). V4 Pro: 총 1.6T, 활성 약 49B로, 이는 Artificial Analysis에도 등재되어 있고 vLLM 레시피 페이지에서도 확인됩니다.
• 토큰당 활성 예산 — Flash는 설계상 프리필 단계에서 약 8B, 디코드 단계에서 16B를 활성화하며, 이것이 바로 이 아키텍처의 핵심입니다. Pro는 토큰당 약 49B를 활성화합니다.
• 라이선스 — 둘 다 MIT 오픈 웨이트.
• GA 일정 — 플래시 2026-09-10; V4 Pro 0813 2026-08-13, 4월 프리뷰 이후.

가격 차이가 논거의 전부다
Pro에서는 입력이 4.4배 더 비쌉니다. 출력은 3.3배입니다. 캐시 적중 — 안정적인 시스템 프롬프트를 가진 장시간 에이전트 실행을 지배하는 티어 — 은 7.3배입니다. 양쪽 모두 모든 티어에서 피크가 두 배가 되므로, 피크에서 비율은 동일합니다; 이 격차는 할인 부산물이 아닙니다.
여기에 워크로드를 하나 올려 보자. 한 달에 입력 토큰 1,000만 개를 처리하고 캐시 적중률이 70%이며 출력 토큰이 200만 개인 코딩 에이전트를 가정하자. V4.1 Flash의 비피크 시간대 기준으로 신규 입력 $0.45, 캐시된 입력 $0.021, 출력 $1.20이다: $1.67. V4 Pro의 비피크 시간대 기준으로는 $1.98, $0.154, $3.96이다: $6.09. 의도적으로 평범한 워크로드에서 약 3.6배다.
그것은 DeepSeek 자체의 목록이며, 그것은 실제로 지불하는 가격입니다. 여기서 OrcaRouter는 제공업체 목록 요율을 0% 마크업으로 그대로 전달하므로, DeepSeek 가격 변동은 재포장되지 않고 같은 날 우리 측에 반영됩니다. 두 모델 모두 동일한 키를 사용하며, 이는 아래쪽 섹션 — 더 이상 할 필요가 없는 마이그레이션을 테스트하는 내용 — 과 관련이 있습니다.

DeepSeek V4.1 Flash가 진정으로 앞서는 곳
Flash에 대한 가장 강력한 증거는 DeepSeek의 벤치마크 표가 아니다. 바로 독립적인 Artificial Analysis이며, 해당 모델 페이지에서 직접 확인할 수 있다.
• Intelligence Index — Flash(추론, 최대 노력)는 40점으로 113개 모델 중 6위입니다. V4 Pro 0813(추론, 최대 노력)은 36점으로 7위입니다. 같은 지수, 같은 노력 설정에서 4점 차이로, 더 저렴한 모델이 앞서 있습니다.
• 출력 속도 — 214.4 tokens/s 대 94.4 tokens/s. 2.3배이며, 주장이 아니라 실측된 수치입니다.
• 첫 토큰까지 걸리는 시간 — 1.21초 대 1.74초.
• DeepSWE v1.1 — 추적 중인 리더보드에서 Flash가 74.2점으로 1위를 차지했으며, GPT-6 Astra의 74.10, Claude Opus 5의 74.00, Gemini 3.8 Flash의 73.70을 앞선다. 같은 벤치마크에서 V4 Pro 0813의 62.7은 DeepSeek 자체 수치다. 선두권의 격차는 0.2점으로, 이는 승리가 아니라 동점이다. 그러나 Pro에 대한 11.5점 격차는 동점이 아니다.
• 서빙 효율성 — Flash의 디코더는 계층별로 다시 계산하는 대신 인코더의 최종 은닉 상태에서 전역 KV를 도출하며, 이것이 비대칭적인 8B-prefill / 16B-decode 활성화를 만들어냅니다. SemiAnalysis의 InferenceX 프로파일은 KV 캐시를 토큰당 약 890바이트 — V4 Flash의 약 4분의 1 — 로 제시하며, 영구 KV 스토리지는 약 8분의 1까지 낮아집니다. 이것이 가격이 현재와 같은 이유이며, Pro가 500에서 상한이 걸릴 때 이 모델이 2,500 동시성으로 제공되는 이유이기도 합니다.
• 서비스되는 API에서의 비전 — 가중치에만 있는 것이 아니다. DeepSeek 자체 가격 페이지에는 이미지 입력이 Flash에서는 지원되고 V4 Pro에서는 지원되지 않는 것으로 명시되어 있으며, DeepSeek는 이를 네이티브 멀티모달 이해를 갖춘 첫 플래그십이라고 설명한다. 스크린샷을 읽는 데 별도의 엔드포인트가 필요 없는 첫 DeepSeek 플래그십이다.
인용된 것으로 보게 될 다른 모든 대표 수치 — Terminal-Bench 2.1의 90.6, GPQA Diamond의 90.9, Codeforces 3471 — 는 DeepSeek 자체의 수치이며, 우리가 재현한 것이 아니므로, 이를 염두에 두고 읽어야 합니다.
DeepSeek V4 Pro가 여전히 올바른 선택인 경우
그런 한 주를 보낸 뒤라면 V4 Pro를 무시해버리기 쉽다. 하지만 번복된 지원 중단 발표는 그렇지 않다고 말하고, 사양표 역시 그렇지 않다고 말한다.
Pro는 총 1.6T 파라미터를 보유하고 토큰당 약 49B를 활성화하는 반면, Flash는 디코드 시 16B를 활성화합니다. 지수가 뭐라 하든, 토큰당 용량은 실제 자원이며, 그것이 드러나는 워크로드는 장기 지평의 것들입니다: 수 시간에 걸친 에이전트 실행, 대규모 리팩터링, 초반의 잘못된 선택이 전체 궤적을 망치는 작업들입니다. 4점 지수 격차는 열 개 평가의 평균을 측정할 뿐, 당신 분포의 꼬리를 측정하지 않습니다.
Pro는 또한 이미 검증된 선택입니다. 4월 프리뷰를 거쳐 2026-08-13부터 일반 제공(GA)되었으며, 0813 빌드는 아키텍처가 아닌 포스트 트레이닝에서 성능을 얻었습니다. 동일한 파라미터 수, 프리뷰와 동일한 형태, 다른 동작입니다. 이는 4개월간의 커뮤니티 도구, 공개된 에이전트 하네스, 프롬프트 패턴 및 실패 모드를 의미합니다. Flash는 GA된 지 8일 되었고, 그 주변 생태계는 그에 상응하게 빈약합니다. 팀의 신뢰성이 모델이 정확히 어떻게 실패하는지 아는 데서 나온다면, 그 지식이 있는 곳은 Pro입니다.
그리고 서비스는 중단되지 않았습니다. DeepSeek의 약속은 명시적이고 요금 청구도 변경되지 않았으며, 가중치는 MIT이고, V4 Pro는 여전히 우리 카탈로그에 동일한 정가로 있습니다. 취소된 지원 중단은 집행 유예가 아닙니다 — 이는 DeepSeek가 해당 티어를 계속 제공하겠다는 의사 표명입니다.

두 모델 모두에게 문제 삼을 세 가지
가드레일입니다. 이 결정은 잘못 내리면 대가가 크기 때문이죠.
• 파라미터 수에 대해서는 이견이 있다. 552B는 DeepSeek이 제시한 수치다. 신뢰할 만한 커뮤니티 분석은 공개된 체크포인트가 748B라고 주장한다 — 552B 트랜스포머 백본에 약 196B의 Engram 조건부 메모리 테이블을 더한 것으로, 이 테이블은 신호가 흘러 지나가는 층이 아니라 네트워크의 두 지점에서 참조되는 조회 구조다. 공개된 다운로드는 FP8 덴스 가중치와 FP4 라우티드 전문가로 이루어진 48개 safetensors 샤드 전체에 걸쳐 510.3GB다. 검색을 연산과 별도로 계산하느냐에 따라 두 수치 모두 동시에 맞을 수 있다. 552B를 벤더가 보고한 수치로 취급하고, 배포를 계획하기 전에 디스크 사용량을 확인하라.
• 리더보드 점수는 화면일 뿐, 계약이 아니다.DeepSWE v1.1의 74.2는 하네스 벤치마크다. EyesTech Systems Lab이 자체 공개한 감사는 이러한 Flash급 점수들이 격리된 실제 다중 파일 저장소로 옮겨지면 무너진다고 주장하며, DeepSeek V4.1 Flash를 SWE-bench Pro에서 헤드라인 74.2%에 반해 31.4%로 떨어뜨린다 — 이는 자체 비교에 포함된 프런티어 모델들보다 더 큰 하락폭이다. 그 감사는 독립적이지 않다 — 저자는 자신이 설명하는 바로 그 하네스 악용을 탐지하는 도구를 판매하고 있다 — 그리고 우리는 그것이 재현된 사례를 본 적이 없다. 그래도 올바른 자세는 변하지 않는다: 마이그레이션하기 전에 자신의 저장소에서 검증하라.
• 장황함은 비용 항목이다.Artificial Analysis는 V4.1 Flash가 Intelligence Index 실행에서 2억 5천만(250M) 개의 출력 토큰을 생성한 것으로 측정했는데, 이는 동급 오픈 웨이트 모델의 중앙값 140M과 대비되는 수치이며, 이를 두고 매우 장황하다고 평가했다. 이 가격표에서 출력은 비싼 방향이므로, 소리 내어 생각하는 모델은 자기 절감분을 스스로 갉아먹는다. 추론 비중이 큰 워크로드에서는 토큰 가격만이 아니라 토큰 수까지 예산에 잡아야 한다.
한 가지 더, 아무도 소문을 바탕으로 계획을 세우지 않도록 분명히 말하자면: DeepSeek V4.1 Pro는 출시되지 않았습니다. 취소된 마이그레이션은 "V4.1 Pro 출시 전"의 임시 조치로 설명되었으며, 그 점에 대해 달라진 것은 없습니다.
다음의 경우 DeepSeek V4.1 Flash를 선택하세요
• 워크로드가 대용량이거나 지연 시간에 민감하거나 비용이 제한적인 경우 — 분류, 추출, 라우팅, 요약, 채팅, 대부분의 코드 생성.
• 텍스트와 같은 엔드포인트에서 이미지 입력이 필요합니다. 두 번째 모델이 아닌 단일 호출로 이를 처리하는 첫 DeepSeek 플래그십입니다.
• 프롬프트는 캐시할 수 있습니다. 캐시 적중 시 7.3배에서 격차는 에이전트 트래픽이 존재하는 바로 그곳에서 가장 크며, 안정적인 시스템 프롬프트는 긴 실행 입력의 대부분을 차지합니다.
• 이번 주에는 새로 시작하는 셈이고, 특정 모델의 특성에 맞춰 조정된 하네스가 없습니다. 보호할 것도 없습니다.
• 더 높은 동시성 한도를 원하실 겁니다. 2,500 대 500은 대기열에 들어가기 전에 처리할 수 있는 양에서 다섯 배 차이입니다.
DeepSeek V4 Pro를 선택하세요, 만약
• 이미 프로덕션은 그것에 맞춰 튜닝되어 있습니다. 반전은 시간이 생겼다는 뜻이니, 그 시간을 질문을 피하는 데가 아니라 테스트하는 데 쓰십시오.
• 당신의 작업은 장기적이고 실패 비용이 크며, 당신은 토큰당 약 49B의 활성 파라미터가 Flash의 16B가 주지 못하는 무언가를 제공한다는 것을, 리더보드가 아니라 당신의 데이터에서 측정했습니다.
• 추론할 비전 경로 없이 예측 가능한 텍스트 전용 동작이 필요하거나, 모델 교체가 연구 도중 무효화할 평가 기준선을 가지고 있는 경우.
• 귀하의 접근 패턴은 사용량은 적지만 중요도가 높은 유형으로, 소액 청구서에서 3.6배라는 수치가 결정적인 요소는 아닙니다.
이미 DeepSeek V4 Pro 기반으로 구축했다면
2026-09-11에 달라진 유용한 점은 당신의 마이그레이션이 더 이상 마감 기한이 아니라 결정이 되었다는 것입니다. 그것은 당신에게는 엄밀히 더 좋고 당신의 받은편지함에는 엄밀히 더 나쁩니다. 왜냐하면 그 결정은 여전히 내려져야 하는데 이제는 아무도 당신을 대신해 그것을 내려주지 않기 때문입니다.
먼저 가격을 산정하는 것부터 시작하세요. 3.3–4.4× 격차는 여러분이 그냥 놓치고 있는 숫자이며, 위의 계산 예시를 보면 약 1분 만에 월간 수치로 환산됩니다. 그런 다음, 유일하게 의미 있는 방식으로 테스트하세요. 프로덕션 트래픽의 일부를 Flash로 미러링하고, 기본 경로에는 Pro를 유지한 채, 여러분의 자체 작업에서 출력을 비교하는 것입니다. 두 모델 모두 공급자 정가로 동일한 키에서 응답하고 자동 장애 조치가 이루어지므로, 그 섀도 실행은 두 번째 통합이 아니라 라우팅 변경이며, 라우터는 여러분이 폴백을 작성하지 않아도 요청을 Pro로 되돌릴 수 있습니다. 요청하지도 않은 마이그레이션에 토큰을 태우는 팀들이야말로 라우팅 계층이 애초에 존재하는 이유입니다.
Flash가 즉시 대체 가능한 대안이라고 가정하지 마세요. 그것은 다른 아키텍처입니다 — 비대칭 활성화를 사용하는 40계층 인과적 인코더–디코더이며 — 추론할 때 더 장황합니다. 프롬프트 수준 동작은 어느 방향으로도 깔끔하게 이식되지 않으므로, 마이그레이션은 인덱스가 아니라 출력으로 측정하세요.
볼 것
이 조합이 한 달 뒤 어떤 모습일지는 세 가지가 결정한다. 첫째, V4.1 Pro가 출시되어 진정한 Pro 등급을 복원하는지 — 전체가 취소된 마이그레이션은 명시적으로 그것을 위한 임시방편이었으므로, DeepSeek의 로드맵에는 여전히 플래그십 모양의 구멍이 남아 있다. 둘째, 이 유예가 DeepSeek의 다음 가격 조치에서도 살아남는지; 조용한 경로 변경을 한 번 계획할 의향이 있었던 회사는 그것을 해서는 안 된다는 것이 아니라 할 수 없다는 것을 배운 것이다. 셋째, DeepSeek 외부의 누군가가 수정되지 않은 저장소에서 Flash 벤치마크 수치를 재현하는지, 이것이 이 전체 비교가 달려 있는 효율성 대 용량 논쟁을 해결할 유일한 결과다. 그때까지 정직한 입장은 이번 번복 자체가 시사하는 입장이다: Flash는 새로운 것에는 더 나은 기본값이고, Pro는 이미 구축된 것에는 더 나은 선택이며, DeepSeek는 당신이 어느 쪽인지 알아내는 동안 둘 다 제공하겠다고 방금 말한 것이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
