ByteDance의 Seedance 2.5가 Apiframe에 정식 출시되었습니다.

Wan 3 출시 임박: 지금까지 알려진 것과 우리가 준비하는 것

알리바바는 아직 Wan 3.0을 공식 발표하지 않았지만, 얼리 액세스 데모에서는 30초 길이의 단일 패스 영상에 원본 오디오까지 포함된 결과물이 등장하고 있습니다. 무엇이 실제로 검증됐고, 무엇이 아직 불확실한지, 그리고 출시 첫날부터 어떻게 대비해야 할지 정리했습니다.

Apiframe Team 2026년 8월 5일 게시 2026년 8월 5일 · 7분 읽기
Wan 3 출시 임박: 지금까지 알려진 것과 우리가 준비하는 것

알리바바는 아직 Wan 3.0을 발표하지 않았다. 오늘 기준으로 이 시리즈에서 일반에 공개된 최신 모델은 여전히 Wan 2.7이며, 알리바바 클라우드 모델 스튜디오나 DashScope API 어디에도 "Wan 3.0"이라는 이름은 보이지 않는다. 하지만 7월 31일, AI 툴 플랫폼인 PixelDojo가 차세대 Wan 모델에 대한 얼리 액세스를 받았다고 밝히며, 사운드가 포함된 30초 단일 생성 영상 데모를 공개했다. 여기에 더해 Wan 팀이 7월에 Apache 2.0 라이선스로 음악용 WanSong, 음악-댄스 변환용 Wan-Dancer, 실시간 상호작용용 Wan-Streamer 등 생태계 모델들을 연달아 내놓으면서, 플래그십 릴리스가 가까워 보이는 상황이다.

우리는 Wan 3.0 페이지를 ‘곧 공개 예정’ 상태로 올려 두었고, 실제 출시 시에는 카탈로그의 다른 모델들과 동일한 엔드포인트와 API 키 뒤에서 바로 사용할 수 있게 할 예정이다. 이 글은 지금 실제로 확인된 정보와, 여기저기서 지어지고 있는 얘기를 분리해 정리한 것이다.

Wan 시리즈가 주목할 가치가 있는 이유

Wan은 알리바바 톈이(Tongyi) 랩의 비디오 모델 패밀리이며, 이 영역에서 거의 가장 빠른 속도로 진화하는 계열이다. 대략 1년 만에 여섯 번의 메이저 버전이 나왔다.

결정적인 순간은 2025년 2월이었다. 알리바바가 Wan 2.1 시리즈를 Apache 2.0 라이선스로 오픈소스로 공개하면서, 단일 소비자용 GPU에서도 구동 가능한 1.3B 버전까지 포함시켰다. 이후 200만 회 이상 다운로드되면서, 이를 기반으로 한 수많은 ComfyUI 워크플로와 LoRA 파인튜닝 생태계가 형성되었다. 2025년 7월에는 Mixture-of-Experts 아키텍처를 도입한 Wan 2.2가 뒤이어 나왔다. 전체 파라미터는 270억 개지만, 스텝마다 실제로 활성화되는 파라미터는 140억 개에 불과하고, 장면 레이아웃과 모션을 담당하는 고노이즈 전문가와 디테일과 일관성을 담당하는 저노이즈 전문가로 작업을 분할하는 구조다.

2.5부터는 시리즈에 네이티브 오디오가 추가되었고, 2.6에서는 레퍼런스-투-비디오 기능이 더 강해졌으며, 2026년 4월에는 Wan 2.7에 도달했다. 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오, 인스트럭션 기반 편집까지 네 가지 모드를 지원하며, 최대 15초 길이의 1080p 영상에 동기화된 오디오를 붙일 수 있는 제품군이다. 그 과정에서 어느 순간 "HappyHorse 1.0"이라는 익명 모델이 Video Arena 리더보드에서 텍스트-투-비디오와 이미지-투-비디오 Elo 모두 1위를 차지했는데, 나중에 같은 패밀리 출신인 것으로 밝혀졌다.

얼리 데모가 실제로 보여주는 것

아래에 적힌 내용은 모두 2026년 7월 말에 제3자가 얼리 액세스로 테스트한 결과를 기반으로 한 것이며, 알리바바 공식 정보가 아니다. 향후 방향성에 대해선 강한 신호로, 최종 스펙 수치에 대해선 약한 신호 정도로 보는 것이 좋다.

한 번에 최대 30초까지 생성되는 클립. 이게 핵심이다. Wan 2.7은 대략 15초 정도에서 한계를 보이는데, 이번 데모에서는 2초에서 30초까지의 영상이 한 번에, 이어 붙이기 없이 생성된다. 15초에서 30초로 늘어난다는 것은 단순히 "두 배 길어졌다"는 수준이 아니다. 확산 기반 비디오에서는 시간이 길어질수록 시간적 일관성이 빠르게 붕괴하고, 대부분의 모델이 10초를 넘기면 흐트러지기 시작한다. 안정적인 30초를 뽑아낸다는 것은, 내부 아키텍처에 뭔가 근본적인 변화가 있었다는 뜻이다.

지능형 길이 결정. 길이를 지정하지 않으면 모델이 알아서 선택한다. 한 테스트에서는 "도로 배수구를 따라 흘러가는 종이배"라는 프롬프트에 대해, 요청 어디에도 길이 값이 없었는데 20초짜리 클립이 생성되었다.

사운드를 사후 합성이 아니라 화면과 동시에 생성. 대사, 효과음, 공간음, 음악이 모두 하나의 생성 패스에서 함께 만들어져 출력 파일에 포함된다. 이것이 단순히 나중에 사운드를 덧붙인 게 아니라 구조적으로 통합된 기능이라는 증거는, 사운드를 끈다고 해서 연산 비용이 줄지 않고 켰을 때와 비용이 정확히 같다는 점이다. 한 데모에서는 입 모양과 맞는 네 줄의 대사가 포함된 30초짜리 주방 장면이 생성되었다.

혼합 멀티모달 레퍼런스. 한 번의 요청에 대략 이미지 10장, 비디오 클립 5개, 오디오 클립 5개까지 넣을 수 있는 것으로 보인다. Wan 2.7에서 다룰 수 있었던 레퍼런스는 5개 수준이었다. 하나의 입력에서 캐릭터, 다른 입력에서 환경, 또 다른 입력에서 목소리를 가져와, 텍스트로 설명하는 대로 조합할 수 있다.

풀 테이크를 버텨내는 일관성. 30초짜리 구조 장면에서 두 캐릭터의 의상, 얼굴, 공간적 관계가 전체 구간 동안 유지되었다. 이게 바로 스토리에 그대로 붙여 쓸 수 있는 풋티지와, 샷 중간에 인물이 슬쩍 딴 얼굴로 바뀌어 버리는 풋티지의 차이다.

적응형 화면비. 프롬프트에 "세로형 소셜 광고"라고 쓰면 720x1280 영상이 나오고, "정사각형 제품 루프"라고 쓰면 960x960이 나온다. 두 요청 모두에서 해상도나 비율을 따로 지정하지 않았다.

사실이 아닌 것들

여러 제3자 사이트들이 데모나 공식 문서 어디에도 없는 Wan 3.0 스펙을 퍼뜨리고 있다. 네이티브 4K, 60fps, 60초 클립, 그리고 "뉴럴 피직스 엔진" 같은 것들이다. 어떤 것도 검증되지 않는다.

데모는 1080p다. 꿀이 흐르는 모습, 종이가 떠다니는 움직임, 천의 물리 같은 물리적 사실감은 분명히 개선되었지만, 이는 별도의 물리 엔진 때문이라기보다는 더 나은 학습 데이터와 시간적 모델링 덕분으로 보인다. 실제 물리 엔진을 확산 모델과 통합하는 것은 아직 연구 과제에 가깝다. 일부 사이트는 출시일과 오픈 웨이트 라이선스 여부까지 기정사실처럼 적고 있는데, 이 또한 사실이 아니다. 커뮤니티에서는 8월 초를 점치는 루머가 돌고 있지만, 이를 뒷받침하는 공식 근거는 전혀 없다.

이 모델을 기준으로 프로덕션을 계획하고 있다면, SEO용 페이지가 아니라 데모와 알리바바의 공식 문서를 기준점으로 삼는 것이 좋다.

Seedance 2.5 및 Kling 3.0과의 비교

현재 기준으로 비교 가능한 스펙만 놓고 보면:

SpecWan 3.0 (early testing)Seedance 2.5Kling 3.0
Max single-pass duration30s30s15s
Resolution1080p demonstrated720p maxNative 4K / 1080p
Native audioYesYesYes, multilingual lip-sync
References per request~10 images + 5 videos + 5 audioUp to 50Multi-image + element reference
AvailabilityNot launchedLiveLive

Wan 3.0과 Seedance 2.5는 워크플로를 가장 크게 바꾸는 요소, 즉 하나의 생성으로 전체 내러티브 아크를 뽑아낼 수 있다는 점에서 비슷한 수준이다. Seedance는 레퍼런스 입력량에서 확실히 앞서 있지만, 해상도는 720p가 상한이다(ByteDance가 발표했던 네이티브 4K는 실제 출시 버전에는 반영되지 않았다). Kling 3.0은 클립 길이는 더 짧지만, 그 안에 최대 여섯 개의 감독 의도 기반 샷을 넣을 수 있고, 다국어 대사 지원이 가장 성숙한 편이다.

Wan이 차별화될 수 있는 지점은 이 시리즈가 가진 오픈소스 DNA다. Wan 2.1과 2.2는 Apache 2.0 라이선스로 웨이트를 공개했지만, 2.5와 2.6은 그렇지 않았다. 만약 3.0에서 다시 오픈 웨이트로 돌아간다면, 셀프 호스팅, 파인튜닝, 자체 인프라 내 생성이 필요한 팀에게는 사실상 가장 자연스러운 선택지가 될 것이다.

영상 위에 서비스를 만드는 사람들에게 의미하는 것

실질적인 변화는 30초 길이와 네이티브 오디오가 결합되면서, 모델의 역할이 "소스 풋티지 공급자"에서 "숏폼 필름 프로듀서"에 가까워진다는 점이다. 보통은 5~10초짜리 클립을 여러 개 생성하고, 이를 이어 붙인 뒤, 더빙을 하고, 다시 컷 편집을 하는 파이프라인이 필요했다. 이제는 특정 유형의 작업—틱톡이나 릴스 한 슬롯을 꽉 채우는 소셜 영상, 15~30초짜리 광고 초안, 대화 장면, 나레이션이 들어간 제품 데모 등—에서는 이 모든 과정이 한 번의 호출로 압축된다.

또 한 가지는, 우리가 사용자들에서 반복적으로 보는 패턴을 강화해 준다는 점이다. 어떤 팀도 한 가지 모델만으로 서비스를 내지 않는다. 강한 레퍼런스 컨트롤과 30초 단일 생성이 필요할 때는 Seedance를, 다국어 대사와 타이트한 멀티샷 편집이 필요할 때는 Kling을, Flux 3는(은) 이번 주에 여기에도 추가된, 클립 단위 고정 요금 모델을 쓸 것이고, 길게 한 번에 이어지는 내러티브나 셀프 호스팅으로 가는 경로가 필요할 때 Wan 3.0을 찾게 될 겁니다. 흥미로운 질문은 어느 모델이 이기느냐가 아니라, 그 둘 사이를 얼마나 빠르게 오갈 수 있느냐입니다.

첫날부터 준비되어 있기

지금 우리가 할 수 있는 부분은 바로 이겁니다. Apiframe의 모든 모델은 동일한 POST 엔드포인트, 동일한 API 키, 동일한 비동기 작업 패턴, 동일한 선불 크레딧 위에서 돌아갑니다. 여러분 제품에 새 모델을 추가하는 데 필요한 건 문자열 하나를 바꾸는 것뿐입니다.

오늘 바로 Wan 2.7을 기준으로 개발하세요:

bash
curl -X POST https://api.apiframe.ai/v2/videos/generate \
  -H "X-API-Key: afk_your_api_key_here" \
  -H "Content-Type: application/json" \
  -d '{
    "prompt": "a paper boat washing down a rain-filled gutter, low angle, afternoon light, ambient street sound",
    "model": "wan-2.7"
  }'

요청을 보내면 곧바로 작업 ID를 돌려받고, 이후에는 /v2/jobs/:id 를 폴링하거나 webhookUrl 을 설정해 두고 클립이 준비되었을 때 우리가 호출하도록 맡기면 됩니다. Wan 3.0이 출시되면, "model": "wan-2.7""model": "wan-3.0" 으로 바뀌고, 그 외 여러분의 연동 부분은 그대로 유지됩니다. 새 계정도, 새 SDK도, 별도의 알리바바 청구 계약도, 마이그레이션 프로젝트도 필요 없습니다.

Wan 3.0은 해상도와 관계없이 출력 초당 26크레딧($0.26)으로 과금되며, 다른 모든 모델과 동일한 선불 크레딧에서 차감됩니다. 이미 apiframe.ai/pricing 에서 확인하실 수 있습니다.

업데이트 따라가기

지켜볼 만한 신뢰할 수 있는 채널은 Wan-Video GitHub 조직, Hugging Face의 Wan-AI 모델들, 그리고 Alibaba Cloud Model Studio의 릴리스 노트입니다. 저희는 이 세 곳을 모두 모니터링하고 있으며, Wan 3.0용 API가 공개되는 즉시 Apiframe에서도 곧바로 사용할 수 있게 할 예정입니다.

API 키를 발급받아 지금 바로 Wan 2.7을 써보시거나, Wan 3.0 페이지 를 구독해 출시를 기다리셔도 됩니다. Wan 3.0이 Seedance 2.5를 이길지 토론해 보고 싶다면, 저희 Discord 에서 이미 그 얘기가 한창입니다.

Apiframe Team

The team behind Apiframe - making AI generation accessible to everyone.

Apiframe 뉴스레터

새로운 모델, 엔지니어링 노트, 빌드 가이드를 받은편지함으로 보내드립니다. 광고 없이, 언제든 구독 해지할 수 있습니다.