DeepSeek V4.1 Flash 출시, V4 Pro가 사라지기 전에 볼 점

한눈에 결론

  • 2026년 9월 10일 DeepSeek가 DeepSeek V4.1 Flash를 공식 출시했습니다. API 호출명은 deepseek-flash입니다.
  • 회사 설명은 5520억 파라미터 MoE, 입력 활성 80억·출력 활성 160억, 컨텍스트 100만 토큰, 네이티브 이미지 이해입니다. 가중치는 Hugging Face에 MIT 라이선스로 올라와 있습니다.
  • 공식 API 한가 요금(백만 토큰)은 캐시 적중 0.02원, 캐시 미적중 1원, 출력 4원입니다. 피크는 그 두 배입니다.
  • 기존 V4 Flash는 이미 내려갔고, 2026년 9월 14일 12:00(한국 13:00) 이후 deepseek-v4-pro 요청은 V4.1 Flash로 라우팅되며 Flash 요금이 적용됩니다. V4.1 Pro 일정은 아직 없습니다.
  • 코딩·에이전트 작업을 API로 돌리거나 오픈 웨이트를 시험할 사람에게는 바로 해당합니다. V4 Pro만의 동작에 의존하는 파이프라인이 있으면 14일 전에 회귀 테스트가 필요합니다.

Fact Check

항목 현재 판정 근거
2026-09-10 V4.1 Flash 공식 출시 사실 DeepSeek 공식 발표·API 변경 로그
API 모델명 deepseek-flash 사실 공식 API 문서
552B MoE, 입력 8B·출력 16B 활성 사실(회사 사양) 공식 발표·Hugging Face 모델 카드
컨텍스트 1M, 최대 출력 384K, 비전 지원 사실 공식 가격·모델 문서
가중치 MIT 공개 사실 Hugging Face deepseek-ai/DeepSeek-V4.1-Flash
V4.1 Flash가 GPT-6 Astra·Claude Opus 5를 앞선다 회사 벤치마크·2차 인용 공식 숫자는 자사 표. 독립 재현은 이 글 작성 시점 기준 충분하지 않음
9월 14일 이후 V4 Pro 요청이 Flash로 바뀐다 사실(예정 정책) 공식 API 문서. V4.1 Pro 출시일 미정
상하이 STAR 시장 IPO 준비 언론 보도 로이터. 이번 모델 발표문 본문 사항 아님

확인일: 2026-09-11. 1차 출처는 DeepSeek 공식 발표, API 가격 페이지, Hugging Face 모델 카드입니다. 경쟁 모델 비교 점수는 회사 표를 그대로 사실로 단정하지 않습니다.


9월 10일에 실제로 바뀐 것

DeepSeek V4.1 Flash를 검색하는 이유는 대개 두 가지입니다. 새 모델이 기존 Flash보다 나은지, 그리고 쓰던 V4 Pro가 며칠 뒤에도 그대로인지입니다. 공식 답은 둘 다 한 페이지에 있습니다. 2026년 9월 10일 모델이 올라왔고, 같은 문서가 9월 14일 V4 Pro 라우팅 변경을 못 박습니다.

호출 이름은 deepseek-flash입니다. 예전 deepseek-v4-flashdeepseek-v4-flash-vision-exp는 모델이 내려간 상태입니다. 호환을 위해 그 이름은 당분간 V4.1 Flash로 넘어가며 Flash 요금이 붙습니다. 앱에서 쓰던 사람은 별도 설치보다 모델 선택 화면이 바뀌었는지부터 보면 됩니다.

회사는 이 모델을 “새 구조 계열의 가장 작은 크기”라고 적었습니다. 작은 실험 모델이라는 뜻이 아닙니다. 총 파라미터는 5520억이고, 한 토큰을 처리할 때 켜지는 양은 입력 80억·출력 160억입니다. 컨텍스트는 100만 토큰, 최대 출력은 38만 4000토큰입니다. V4 Pro에는 없던 네이티브 이미지 이해가 Flash에 들어가 있습니다.

가중치는 Hugging Face 저장소 deepseek-ai/DeepSeek-V4.1-Flash에 MIT 라이선스로 공개됐습니다. 기술 보고서는 같은 저장소의 PDF입니다. 오픈 웨이트라고 해서 노트북 한 대로 바로 돌아가지는 않습니다. 자체 호스팅은 다중 GPU와 저장 클러스터가 필요한 규모입니다.


입력 80억, 출력 160억이 요금에 닿는 지점

공식 구조 이름은 Causal Encoder–Decoder입니다. 입력을 읽는 구간과 답을 쓰는 구간의 활성 파라미터를 다르게 둔 설계입니다. 회사 설명은 입력 쪽을 얇게 만들어 긴 프롬프트·에이전트 기록을 싸게 읽고, 출력 쪽에서만 더 많은 전문가를 켠다는 것입니다.

더 직접적인 비용 항목은 KV 캐시입니다. DeepSeek는 이전 세대 대비 HBM 요구량을 4분의 1, SSD 요구량을 8분의 1로 줄였다고 적었습니다. 에이전트 작업은 같은 시스템 프롬프트와 도구 설명을 반복해서 넣습니다. 그 반복분이 캐시에 맞으면 입력 요금이 크게 떨어집니다. 공식 한가 기준으로 캐시 적중은 백만 토큰 0.02원, 미적중은 1원입니다. 같은 입력이라도 적중 여부에 따라 50배 차이가 납니다.

아래는 푸른색, 위는 호박색인 두 층 신경망 블록 개념 이미지
공식 설명의 Causal Encoder–Decoder는 입력과 출력의 활성 파라미터를 다르게 둡니다. 이미지는 개념도이며 모델 내부 구조의 실사가 아닙니다.

모델 카드는 추가로 Engram 조건부 메모리 1960억 파라미터, Compressed Sparse Attention 2, FP4 KV 캐시 같은 구현을 적습니다. 이용자가 API만 쓴다면 이 이름을 외울 필요는 없습니다. 확인할 값은 응답의 prompt_cache_hit_tokensprompt_cache_miss_tokens입니다. 적중률이 낮으면 구조가 싼 것이 아니라, 프롬프트를 매 요청마다 조금씩 바꿔 캐시를 깨고 있을 가능성이 큽니다.

누구에게 필요한가 / 굳이 필요 없는가

  • 바로 볼 사람: DeepSeek API로 코딩·도구 호출·긴 컨텍스트 작업을 돌리는 개발자. 9월 14일 전에 모델명과 요금을 맞춰야 합니다.
  • 시험해 볼 사람: 오픈 웨이트를 자체 서버에 올려 보는 팀. MIT 가중치와 기술 보고서가 공개된 상태입니다. 하드웨어 여유가 없으면 API가 먼저입니다.
  • 급하지 않은 사람: 채팅 앱에서 가끔 질문만 하는 이용자. 앱이 백엔드를 바꾸면 체감은 생기지만, 요금표와 라우팅을 직접 만질 일은 없습니다.
  • 보류할 사람: V4 Pro의 특정 거절·톤·도구 순서에 맞춘 자동화가 있는 팀. 회사는 Flash가 Pro를 앞선다고 하지만, 그 주장은 자사·우호 테스트입니다. 회귀가 있으면 14일 전에 다른 모델로 고정할지를 정해야 합니다.

DeepSeek V4.1 Flash 가격과 피크 시간

공식 가격 페이지 기준, 한국 이용자가 바로 쓰는 숫자는 위안 표입니다. 한가(빈 시간)는 피크의 절반입니다.

항목(백만 토큰) V4.1 Flash 한가 V4.1 Flash 피크 V4 Pro 한가(14일 전까지) V4 Pro 피크(14일 전까지)
입력 · 캐시 적중 0.02원 0.04원 0.15원 0.30원
입력 · 캐시 미적중 1원 2원 4.5원 9원
출력 4원 8원 13.5원 27원
동시 요청 한도 2500 500

달러 표도 같은 페이지에 있습니다. Flash 한가 기준 캐시 적중 0.003달러, 미적중 0.15달러, 출력 0.60달러입니다. 피크는 각각 0.006달러, 0.30달러, 1.20달러입니다. 환율보다 중요한 것은 피크 창입니다.

피크는 협정 세계시 월요일~금요일 01:00–04:00, 06:00–10:00입니다. 한국 시간으로는 월요일~금요일 10:00–13:00, 15:00–19:00입니다. 주말과 그 밖 시간은 한가입니다. 새 요금은 2026년 9월 10일 13:00(한국)부터 적용됐습니다.

DeepSeek V4.1 Flash 가격 인포그래픽, 캐시 적중 한가 0.02원, 캐시 미적중 한가 1원, 출력 한가 4원, 9월 14일 V4 Pro 전환
공식 API 한가 요금(백만 토큰, 위안)입니다. 피크는 두 배이고, 9월 14일 이후 V4 Pro 요청도 이 요금으로 바뀝니다.

같은 작업을 피크에 돌리면 요금이 두 배가 됩니다. 배치 요약, 야간 평가, 대량 색인은 한가 시간으로 미루는 편이 맞습니다. 대화형 코딩처럼 낮에만 쓰는 트래픽은 피크를 피할 수 없습니다. 그때 남는 레버는 캐시입니다. 시스템 프롬프트와 도구 스키마를 앞에 고정하고, 매번 바뀌는 부분만 뒤에 두면 적중률이 올라갑니다.


회사 벤치마크에서 앞서는 항목, 아직 부족한 항목

공식 변경 로그가 적은 숫자는 다음과 같습니다. GPQA Diamond 90.9, Codeforces 레이팅 3471, Terminal-Bench 2.1 90.6, DeepSWE v1.1 74.2, CyberGym 88.1입니다. 도구를 켠 HLE는 63.9, 순수 텍스트 HLE는 36.8(텍스트 부분집합 39.1)입니다. Terminal-Bench 4.0은 31.2로, 2.1과 격차가 큽니다.

2차 매체는 같은 표를 인용해 DeepSWE에서 Claude Opus 5(74.0), GPT-5.6 Sol(73.0)과 비슷하거나 조금 앞선다고 적었습니다. 그 비교는 DeepSeek가 고른 벤치마크와 설정에 의존합니다. 이 글은 “코딩 에이전트 일부 항목에서 회사 표가 플래그십과 근접하다” 정도로만 읽습니다. 수학·난이도 높은 추론에서 닫힌 모델보다 낮다는 해석도 같은 표 안에 같이 있습니다.

V4 Pro 대비 주장은 더 단정적입니다. 회사는 성능·비용·속도·총 소요 시간에서 Flash가 Pro를 앞선다고 보고, 그래서 Pro를 정리한다고 적었습니다. 이용자 쪽에서 확인할 방법은 간단합니다. 지금 쓰는 Pro 프롬프트 20~50개를 Flash에 그대로 넣고, 실패 유형이 늘었는지만 보면 됩니다. 점수표보다 그 목록이 결정에 가깝습니다.


9월 14일 전에 바꿀 설정

한국 시간 2026년 9월 14일 13:00 이후 deepseek-v4-pro는 V4.1 Flash로 넘어갑니다. 요금도 Flash 단가입니다. V4.1 Pro가 나올 때까지 이 상태가 유지됩니다. 출시일은 공식문에 없습니다.

9월 14일 전에 확인할 것 체크리스트, 모델명 deepseek-flash, 피크 시간 확인, 캐시 적중률 보기, Pro 고정이 필요하면 대안
API를 쓰는 팀이 9월 14일 전에 확인할 네 가지입니다. 채팅 앱만 쓰는 경우에는 모델명 변경 공지만 보면 됩니다.

실제 점검 순서는 아래가 짧습니다.

  1. 코드와 프롬프트 라우터에서 모델명을 deepseek-flash로 바꿉니다. 옛 이름을 남겨도 당장은 통과하지만, 폐기된 ID에 의존하면 다음 정리 때 다시 깨집니다.
  2. 응답 usage에서 캐시 적중·미적중을 로그로 남깁니다. 적중률이 낮으면 공통 접두를 고정합니다.
  3. 주중 낮 한국 시간 10–13시, 15–19시에 돌아가는 작업과 그 밖 작업을 나눕니다. 미룰 수 있는 작업만 한가에 넣습니다.
  4. Pro 전용으로 맞춰 둔 거절 문구, JSON 스키마, 도구 호출 순서가 있으면 14일 전에 Flash로 재실행합니다. 차이가 크면 당분간 다른 공급자 모델로 고정합니다.
  5. 이미지를 넣는 워크플로가 있으면 Pro가 아니라 Flash 쪽입니다. 공식 표에서 V4 Pro는 비전 미지원, Flash는 지원입니다.

자체 호스팅을 계획 중이면 가중치와 보고서를 받는 것과, 실제 서빙을 켜는 것을 분리하는 편이 낫습니다. DeepSeek는 대규모 GPU와 스토리지 클러스터 상담을 공식 페이지에서 따로 안내합니다. vLLM·SGLang 경로가 모델 카드에 언급되지만, 단일 소비자 그래픽카드로 5520억 MoE를 그대로 돌린다고 보면 안 됩니다.

자주 생기는 실수

  • 모델명만 바꾸고 로그는 안 보는 경우. 요금이 줄었는지, 캐시가 맞았는지는 usage 필드가 있어야 확인됩니다.
  • 피크 시간을 UTC로만 적어 두고 한국 스케줄러에 그대로 넣는 경우. 월~금 10–13시, 15–19시(한국)가 피크입니다.
  • 매 요청마다 날짜·난수·전체 대화 기록을 프롬프트 맨 앞에 붙이는 경우. 공통 접두가 흔들리면 캐시 적중이 거의 없어집니다.
  • V4 Pro 시절 JSON이 잘 나왔다고 스키마 검증을 끄는 경우. Flash로 바뀐 뒤 필드 누락이 있으면 다운스트림이 먼저 깨집니다.

전환 후에도 기대와 다르면

답이 짧아지거나 도구를 덜 부르면, 사고 모드(thinking) 설정을 공식 문서 기준으로 다시 확인합니다. 기본값이 사고 모드인 점이 가격 페이지에 적혀 있습니다. 사고 토큰도 출력으로 과금되므로, 짧은 분류 작업에는 비사고 모드가 맞을 수 있습니다.

이미지가 안 들어가면 엔드포인트와 모델명을 봅니다. 비전은 Flash에 있고 V4 Pro 문서에는 없습니다. 옛 Pro 엔드포인트에 이미지를 붙인 채 14일을 넘기면, 라우팅은 Flash로 가더라도 클라이언트 코드가 이미지 필드를 빼고 있을 수 있습니다.

지연이 늘면 컨텍스트 100만을 다 채우고 있는지부터 줄입니다. 회사 사양이 길다고 해서 매 요청에 히스토리를 통째로 넣는 설계가 이득은 아닙니다. 최근 N턴만 남기고, 고정 지시는 캐시 접두에 두는 편이 안정적입니다.

그래도 Pro 때와 결과가 갈리면 대안은 두 가지입니다. 중요한 경로만 다른 공급자 모델로 고정하거나, V4.1 Pro가 공개될 때까지 해당 작업의 자동 실행을 멈추고 사람 확인을 넣습니다. DeepSeek가 Flash를 Pro 대체재로 못 박은 이상, 같은 계정 안에서 옛 Pro 엔진을 선택하는 스위치는 기대해선 안 됩니다.


지금 고를 세 갈래

첫 갈래는 API를 Flash로 옮기는 것입니다. 요금이 내려가고 동시 한도가 500에서 2500으로 늘어난 상태입니다. 코딩 에이전트, 문서 검색 후 답변, 이미지+텍스트 작업을 이미 DeepSeek로 돌리던 팀에 해당합니다.

둘째는 앱 이용자입니다. 공식 앱이 백엔드를 V4.1 Flash로 바꿨는지는 앱 설정·모델 표기를 보면 됩니다. 요금표를 만질 필요는 없습니다. 체감이 이상하면 같은 질문을 웹과 앱에서 한 번씩 비교하면 충분합니다.

셋째는 기다림입니다. V4.1 Pro 일정은 없습니다. Pro라는 이름에 기대어 더 큰 모델을 예약해 둔 상태라면, 지금은 Flash가 Pro를 대체한다는 회사 주장을 실험으로 검증하는 주이지, 상위 요금제를 미리 살 단계는 아닙니다. 로이터가 적은 상하이 STAR 시장 상장 준비는 이번 출시 발표의 이용 조건이 아닙니다.

요금만 보면 Flash가 항상 이득입니다. 다만 품질 회귀가 비용 절감보다 비싼 업무가 있습니다. 고객 메일 초안, 보안 점검 스크립트, 계약 조항 추출처럼 한 번의 잘못된 도구 호출이 외부로 나가는 작업이 그렇습니다. 이런 작업은 14일 전에 A/B를 끝내고, 통과한 작업만 자동 라우팅에 남깁니다.

반대로 로그 요약, 코드 리뷰 초안, 사내 위키 검색처럼 사람이 한 번 더 보는 작업은 Flash로 옮겨도 부담이 작습니다. 동시 한도가 500에서 2500으로 늘어난 점도 이 구간에 유리합니다. 대기열 때문에 Pro를 쓰던 팀이면 한도부터 다시 재는 것이 맞습니다.

정리하면, 9월 10일 출시의 실무 의미는 새 벤치마크 숫자보다 9월 14일 라우팅입니다. 모델명을 바꾸고, 피크와 캐시를 확인한 뒤, Pro에 묶인 자동화만 회귀하면 이번 업데이트는 끝입니다.


출처

확인일: 2026-09-11. 가격·일정·모델명은 공식 문서가 이후 개정되면 그 페이지가 우선입니다.

0 0 votes
Article Rating
Subscribe
Notify of
guest
0 Comments
Oldest
Newest Most Voted
0
Would love your thoughts, please comment.x
()
x