Wan 3.0 AI 립싱크

얼굴을 넣고 대사를 따옴표로 적으면 입이 말을 따라갑니다. Wan 3.0 립싱크는 목소리를 그림과 같은 패스에서 만들기 때문에, 먼저 녹음할 오디오 파일도 나중에 할 더빙 작업도 없습니다. 2초에서 30초, 소리는 MP4 안에, 그리고 첫 클립은 값이 들지 않습니다.

화자

이미지 만들기

JPG · PNG · BMP · WEBP · ≤20MB · 240–8000px · 비율 ≤8:1

0 / 20000

화자는 끝까지 같은 얼굴·머리·옷·색을 유지합니다. 바뀌는 것은 카메라와 서술된 움직임뿐입니다.

Model
Aspect ratio
Duration
Resolution
무료 회원가입 · Wan 3.0 클립 1편

무료 클립은 소리까지 같은 Wan 3.0이고 480P · 3s로 제한되며 공용 대기열을 씁니다. 요금제가 상한을 올려 1080P와 30초로 갑니다 — 무료 등급은 해상도이지 다른 모델이 아닙니다.

진짜 모델로 클립 1편 무료 · 이메일만, 카드 없이 · 소리를 켜도 끈 것과 값이 같습니다

알리바바 자신의 Wan 3.0 대사 데모 · 이거 써 보기를 누르면 프롬프트가 들어옵니다

주방 카운터에서 분홍색 휴대용 블렌더를 들고 카메라를 똑바로 보며 말하는 여성카메라를 보고 · 9:16 · 720P

카메라를 보고, 대사 여섯 개 길이

무엇이 돌아오는가

프롬프트에 대사가 들어 있을 때 Wan 3.0이 하는 일

여기 있는 클립은 전부 알리바바가 Wan 3.0을 위해 공개한 데모이고, 각각 그것을 만든 프롬프트와 함께 왔습니다. 목소리는 소리 듣기를, 전체를 이 페이지 맨 위 칸에 넣으려면 프롬프트 사용을 누르세요 — 쓰인 언어 그대로, 전문이 실려 있습니다.

  • 1패스그림과 말소리와 입 움직임이 한 번의 생성에
  • $0오디오 트랙에 붙는 추가 요금
  • wan3.0-video이 띠의 모든 클립 뒤에 있는 모델
  • 주방 카운터에서 분홍색 휴대용 블렌더를 들고 카메라를 똑바로 보며 말하는 여성레퍼런스
    카메라를 보고 여섯 대사, 제품은 레퍼런스 이미지에 붙들려
  • 뒤에 DJ가 있고 너머로 도시 스카이라인이 보이는 밤 옥상 무대 정중앙의 가수레퍼런스
    언어를 바꿔 가는 가수 한 명, 여덟 번 모두 유지되는 동기
  • 햇빛이 드는 나무 도장에 서 있는 긴 회색 코트와 고글 차림의 남자레퍼런스
    화자 둘, 일본어, 각자 한 대사씩 겹침 없이
  • ModelTalk 네온사인 아래 팟캐스트 마이크 앞에서 헤드폰을 쓴 노란 고양이와 골든 리트리버첫 프레임
    동물 둘의 스틸 한 장이 열 번의 주고받기가 됩니다

대사가 제대로 꽂히게 하는 것

  • 정확한 대사를 따옴표로. 요약하면 모델이 지어낸 대사가 나옵니다.

  • 화자

    누가 말하는지 못 박으세요 — 나이, 머리, 옷 — 아니면 엉뚱한 입이 움직입니다.

  • 카메라

    대사가 이어지는 동안 카메라를 얼굴에 두세요.

  • 텍스트

    자막 없음으로 닫으세요. 아니면 대사가 화면에 찍혀 올 수 있습니다.

텍스트 프롬프트에서

간단한 텍스트 프롬프트로 AI 립싱크 영상 만들기

대본 형식도, 타임라인도, 음성 파일도 없습니다. 평범한 문장으로 숏을 설명하고, 인물이 하는 말을 따옴표로 적어 화면 속 사람에게 붙이면, Wan 3.0이 한 번의 요청으로 그림을 생성하고 목소리를 합성하고 거기에 입을 맞춥니다.

프롬프트 하나, 대사 하나

Medium A-roll. The woman stands behind the kitchen counter
holding the pink portable blender, speaking naturally to camera.
She says: "I get asked how I make smoothies so quickly."
No subtitles, no text overlays, no UI, no watermark.

  • 숏, 카메라, 그리고 누가 말하는지
  • 따옴표 안의 대사, 그리고 찍히면 안 되는 것
2484 / 20,000

한 번의 패스로 나온 것

주방 카운터에서 분홍색 휴대용 블렌더를 들고 카메라를 똑바로 보며 말하는 여성9:16 · 720P · 30S

wan3.0-video · 16:9 · 720P · 14초 · 말소리와 입이 같은 패스에서

위 네 줄은 알리바바 자신의 30초 데모에서 가져온 것이고, 그 데모는 20,000자 한도에 대해 2,484자입니다. 그 여유는 화자와 제품과 제외 항목을 못 박는 데 쓰는 것이지 더 길게 쓰라는 뜻이 아닙니다. 인물 사진을 설명하는 대신 올린다고 해서 대사 자체를 쓰는 법이 달라지지는 않습니다.

크레딧을 쓰기 전에

립싱크 영상 프롬프트를 AI로 다듬기

잘못 돌아온 실행이 모델 문제인 경우는 거의 없습니다. 그림만 지목하고 연기와 카메라와 자막 규칙은 운에 맡긴 프롬프트일 뿐입니다.

프롬프트 생성기는 시키고 싶은 대사를 받아 그 둘레에 Wan 3.0 프롬프트 한 벌을 돌려줍니다 — 화자를 못 박고, 카메라 움직임 하나에 이름을 붙이고, 소리 층을 순서대로 세우고, 대사를 구분자로 감싸 서술이 아니라 연기가 되게 합니다. 이 모델이 실제로 강제하는 규칙에 결과를 대조하므로, 사람들이 잊는 그 한 절이 크레딧을 쓴 뒤가 아니라 쓰기 전에 붙습니다.

  1. 01

    시키고 싶은 대사를 적으세요

    한 문장이면 시작하기에 충분합니다. 누가 말하고 어디인지는 조각이어도 됩니다.

  2. 02

    그 둘레로 지어진 프롬프트를 받으세요

    화자, 카메라, 소리 층, 그리고 구분자로 감싼 대사를 Wan 3.0이 읽는 순서대로.

  3. 03

    여기로 보내고 얼굴을 더하세요

    프롬프트는 길이와 비율이 이미 맞춰진 채로 이 페이지 맨 위 칸에 도착합니다.

프롬프트 생성기 열기

연기가 마음에 들었던 클립이 이미 있나요? 영상에서 프롬프트 추출이 그 대사를 받아 적어 중괄호 안에 넣어 돌려줍니다 — 이 모델이 서술이 아니라 연기하는 그 형태로.

처음부터 끝까지

대본에서 영상까지, 온전한 AI 작업 흐름

같은 엔드포인트로 들어가는 문이 넷입니다. 손에 든 것이 무엇이든 — 대본 한 문단, 자료 한 벌, 인물 사진 한 장, 이미 생성해 둔 클립 — 거기서 말하는 테이크까지 가는 길이 있고, 어느 길도 음성 도구를 따로 붙일 필요가 없습니다.

  • 번잡한 도심 광장의 탁자에서 청년과 노부인이 체스를 두는 장면

    대본 → 프롬프트

    대사를 건네면 그 둘레로 지어진 숏 설명 한 벌을 받습니다. 화자는 못 박혀 있고, 대사는 이미 그 사람에게 붙어 있습니다.

    무료 · 크레딧 없이
  • 탁 트인 고속도로 위의 장거리 트럭이 걸어 다니는 기계로 펼쳐지는 장면

    자료나 페이지 → 대본

    PDF나 공개 URL이, 아바타가 슬라이드를 읽어 주는 것이 아니라 숏을 세우는 이야기가 됩니다.

    50페이지 · 100 MB
  • 타일이 깔린 사무실 화장실의 정장 차림 남자 둘, 한 명은 대사 도중

    인물 사진 + 대사 → 말하는 테이크

    얼굴이 1번 프레임으로 들어가고, 대사가 따옴표와 함께 누구 것인지 붙어 들어가고, 입이 그것을 따라갑니다.

    2–30초 · 1080P까지
  • 쇼핑몰 중앙홀의 와이드, 엘리베이터 안, 클로즈업에 걸쳐 유지되는 같은 빨간 머리 여성

    새 대사, 같은 테이크

    다시 찍지 않고 기존 클립이 하는 말을 바꿉니다. 화자와 타이밍과 화면은 그대로 두고 입 움직임만 다시 생성합니다.

    이미 갖고 있는 푸티지

위의 것들은 모두 같은 곳에 도착합니다 — 내 작업물에 실행마다 MP4와 프롬프트와 작업 ID가 남으므로, 마음에 들었던 테이크는 다시 만들지 않고 다시 열면 됩니다.

전체 절차

Wan 3.0으로 사진에 립싱크 입히는 법

사람들이 틀리는 단계는 세 번째입니다. 모델이 짐작할 수 없는 말을 쓰는 대신, 모델이 이미 볼 수 있는 그림을 설명하는 것.

  1. 얼굴을 끌어다 놓으세요

    검사는 브라우저 안에서 즉시 돕니다. 괜찮은 파일은 초록 줄로 나오고, 아닌 파일은 돈을 쓰기 전에 고칠 곳을 짚어 줍니다.

    무료로 검사
  2. 대사를 따옴표로 적고, 누가 말하는지 밝히세요

    정확한 말을 따옴표 안에, 화면 속 인물에게 붙여서. 요약하면 — "그녀가 안심시키는 말을 한다" — 모델이 지어낸 대사가 돌아옵니다.

    정확한 말만
  3. "no subtitles"로 닫으세요

    네거티브 프롬프트 칸이 없으므로, 대사를 찍지 말라는 지시도 다른 문장과 똑같은 문장입니다. 한 절이면 되고, 실행 한 번을 아낍니다.

    한 절
  4. 길이와 해상도를 정하고 생성하세요

    대사에 필요한 초를 먼저 사세요. 말소리와 룸톤과 입 움직임이 이미 들어 있는 MP4 하나가 돌아옵니다.

    1080P까지

짧은 클립은 90초쯤 걸리고, 도는 동안 탭을 닫아도 됩니다. 올린 사진은 절대 수정되지 않습니다 — 결과물은 새 파일입니다.

여기서 립싱크가 뜻하는 것

당신의 사진이 1번 프레임입니다. 목소리는 올리는 것이 아니라 쓰는 것입니다.

이 분야의 도구는 대개 그림과 오디오 파일을 받아 입을 거기에 맞춥니다. 이것은 그림과 문장을 받습니다.

Wan 3.0 립싱크 클립의 시작 프레임으로 쓰인 인물 사진

프레임 001 · 당신의 얼굴

여기서부터는 말하고, 맞춰집니다

Wan 3.0 립싱크는 당신의 사진을 말 그대로 첫 프레임으로 넣고 거기서부터 2초에서 30초를 앞으로 생성합니다. 30 fps로 480P, 720P 또는 1080P입니다. 따옴표로 적은 말은 그 클립 자신의 오디오 트랙에 말소리로 돌아오고 입이 거기에 맞춰 움직입니다. 그림과 소리를 둘로 나눠 붙이는 것이 아니라 같은 패스에서 생성하기 때문입니다.

당신의 사진이 첫 프레임
001

당신의 사진이 첫 프레임

당신이 준비해야 하는 오디오 파일
0

당신이 준비해야 하는 오디오 파일

어떤 정수 초든
2–30초

어떤 정수 초든

돌아오는 MP4, 소리는 이미 그 안에
1

돌아오는 MP4, 소리는 이미 그 안에

  • 생성 전에 거치는 TTS 단계 없음
  • 생성 후에 하는 더빙 작업 없음
  • 입을 위해 따로 라이선스할 두 번째 모델 없음

대사

대사가 말소리가 되느냐 화면에 찍히느냐를 가르는 것

문장 둘이 대사가 들리느냐 읽히느냐를 정합니다. 하나는 정확한 말을 화자의 입에 넣고, 다른 하나는 그 말을 그림 밖에 둡니다. 둘 중 하나를 빠뜨리면 실패가 완성되고 과금된 동영상으로 도착합니다.

맞춰진 대사의 해부

말소리와 그림 · 한 패스

…speaking naturally to camera. She says:"It blends everything smooth."

Realistic kitchen ambience, blending motor, casual room tone.No subtitles, no text overlays.

ModelTalk 네온사인 아래 팟캐스트 마이크 앞에서 헤드폰을 쓴 노란 고양이와 골든 리트리버열 번 주고받기 · 720P · 30s
화자 둘, 열 번 주고받기, 그리고 말하는 쪽만 입을 엽니다 — 눌러서 소리 듣기

입이 제대로 움직이려면 필요한 것

3

  • 정확한 말, 요약이 아니라 따옴표로
  • 못 박을 수 있을 만큼 자세히 묘사된 화자
  • 말하는 동안 그 얼굴에 놓인 카메라

사람들이 놓치는 규칙

네거티브 프롬프트 칸이 없으므로 "이건 찍지 마세요"도 프롬프트 안의 여느 문장과 같은 문장입니다. 빼 두면 모델은 당신의 대사를 말하는 동시에 화면에 그릴 것으로 다뤄도 됩니다 — 위에 실린 알리바바 자신의 30초 데모가 바로 그 지시로 끝나는 이유가 이것입니다.

  • no subtitles, no text overlays맞음
  • Negative prompt: subtitles틀림

네거티브 프롬프트처럼 생긴 것은 그릴 말이 더 있는 것으로 읽히고, 요청은 그대로 성공합니다 — 그래서 실패가 화면 어딘가에 "Negative prompt"라는 글자가 박힌 완성된 클립으로 도착합니다.

중괄호도 됩니다 — 이 사이트의 프롬프트 도구들이 내보내는 것이 {like this}입니다. 모델이 실제로 찾는 것은 눈에 보이는 화자가 붙은, 구분자로 감싼 대사이고, 알리바바가 공개한 프롬프트들은 거기에 따옴표를 씁니다. 텍스트로 동영상 만들기에 소리 네 층과 그것들을 부르는 순서가 있습니다.

돈을 쓰기 전에

인물 사진을 검사하세요 크레딧을 쓰기 전에

Wan 3.0이 읽지 못할 얼굴은 생성을 날리는 가장 성가신 방법입니다. 대기열 앞이 아니라 뒤에서 알게 되기 때문입니다. 사진을 여기에 끌어다 놓으면 실제 한도에 대조해 검사합니다 — 형식, 파일 크기, 치수, 비율, 투명도 — 그리고 어느 줄이 걸리든 고칠 방법을 짚어 줍니다. 아무것도 올라가지 않습니다. 검사는 브라우저 안에서 돕니다.

JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 2408,000px · ratio ≤8:1

얼굴 하나가, 입이 그림에서 가장 작은 것이 되지 않게 잡혀 있으면 동기가 쓸 재료가 가장 많습니다. 검사기는 모델을 건드리지 않으므로, 애초에 읽히지 않았을 인물 사진을 알아내는 데는 값이 들지 않습니다.

무엇이 들어가나

Wan 3.0 립싱크 한도 — 인물 사진, 클립, 그리고 목소리

이 줄 중 다섯은 사진을 다스리고, 둘은 나오는 것을 다스리며, 마지막 하나가 아무도 예상하지 못하는 거절을 만듭니다. 이 페이지 맨 위의 업로드 칸이 돈을 쓰기 전에 이미지 줄들을 검사합니다.

고정된 첫 프레임과 음성 녹음은 함께 갈 수 없습니다. 프레임은 입력의 한 계열이고 레퍼런스는 다른 계열입니다. 둘 다 실은 요청은 등급이 낮춰지는 것이 아니라 그대로 거절되므로, 선택은 올리기 전에 이루어집니다.

인물 사진 형식
JPEG · JPG · PNG · BMP · WEBPHEIC는 거절됩니다 — 아이폰의 기본 컨테이너는 목록에 없습니다
공식
인물 사진 용량
≤ 20 MB
공식
크기
각 변 240 – 8,000 px
공식
화면 비율
8:1 – 1:8천장이 아니라 범위입니다 — 1:9 세로단은 9:1 배너와 똑같이 거절됩니다
공식
투명도
받지 않음PNG 알파 채널은 합쳐지는 것이 아니라 거절됩니다
공식
클립 길이
30 fps로 2 – 30초480P, 720P 또는 1080P에서 어떤 정수 초든
공식
레퍼런스 오디오
트랙 5개 · 합계 ≤ 15초WAV 또는 MP3, 각 15 MB까지, 트랙당 1–15초
공식
프레임과 레퍼런스
상호 배타
공식

대사 자체에는 별도의 칸도 별도의 한도도 없습니다. 나머지와 함께 프롬프트 안에 살고, 프롬프트는 20,000자를 담습니다. 발화되는 대사를 묶는 것은 글자 수가 아니라 시계입니다 — 짧은 문장 하나에 화면 시간 2~3초쯤이므로, 4초짜리 클립 안의 열다섯 단어짜리 대사는 급해지거나 잘립니다. 해상도를 사기 전에 대사에 필요한 초부터 사세요.

요금제 · 모든 유료 플랜에서 1080P · 네이티브 오디오

Wan 3.0 립싱크 클립 한 편의 값

값은 길이와 해상도가 정합니다. 말소리는 아닙니다. 오디오 스위치는 돌아오는 것을 바꾸지 값을 바꾸지 않고, 레퍼런스 오디오는 아예 과금되지 않습니다. 실패한 실행은 자동으로 환급되고, 위의 검사기가 피할 수 있는 실패 대부분을 애초에 모델까지 가지 않게 막습니다.

과금 방식

과금 기준
출력 초
말소리, 레퍼런스 오디오
과금 없음
첫 클립
무료 · 480P

연기가 자리를 잡을 때까지 480P로 대사를 다듬고, 그다음 720P나 1080P로 한 번 쓰세요 — 실행 사이에 인물 사진을 다시 검사할 필요는 없습니다. 요금제 전체.

어느 쪽이든 월 크레딧은 같습니다

  • 무료 첫 클립카드 없이

    진짜 wan3.0-video로 생성 한 번. 당신의 숏으로 Wan 3.0이 무엇을 하는지 보세요 — 480P, 3초, 소리도 같은 패스에서.

    $0한 번

    어느 단계에서도 카드 없음

    무료 클립 생성하기

    이메일만, 카드는 필요 없음

    클립 1편, 한 번만

    480P · 최대 3초 · 소리 포함
    이메일만, 카드는 필요 없음

    알리바바가 유료 플랜에 돌리는 것과 같은 `wan3.0-video`입니다 — 480P는 해상도이지 낮은 모델이 아닙니다

    • 2.7이 아니라 진짜 wan3.0-video
    • 소리를 그림과 함께 생성
    • 영수증에 찍히는 모델 ID와 작업 ID
    • 실패한 생성은 절대 과금되지 않음
    • 720P와 1080P유료
    • 3초보다 긴 클립유료
    • 레퍼런스·문서·편집 모드유료
    • 클립 한 편을 넘겨서, 계속유료

    여기서 답하는 질문은 하나입니다. 당신의 아이디어로 Wan 3.0이 무엇을 하는가. 1080P와 30초, 그리고 모든 입력 모드는 $12.90부터입니다.

    한눈에

    월 클립 수
    1편, 한 번만
    생성당 테이크 수
    1
    가장 긴 클립
    3s
    최상위 해상도
    480P
  • Starter최대 20% 절약

    주에 출시 게시물 하나. Wan 3.0 AI 동영상 생성기가 당신의 작업 방식에 맞는지, 분량을 결정하지 않고도 알아보기에 충분합니다.

    $12.90/ 월$15.90

    연 $154.80 청구

    언제든 해지

    월 640 크레딧 · ≈ 16편

    480P 5초 기준 · 720P면 8편 · 1080P면 4편

    플랜 크레딧은 월말에 소멸합니다

    • 월 640 크레딧 — 완성된 클립 약 16편
    • 한 번 실행에 같은 프롬프트 테이크 2개
    • 모든 해상도 — 480P, 720P, 1080P
    • 모든 길이 — 한 번에 2초부터 30초까지
    • 모든 입력 — 텍스트, 사진, 레퍼런스, 문서, 웹페이지
    • 소리는 같은 패스에서, 워터마크 없음
    • 상업적 이용 포함 — 공개하고, 팔고, 청구해도 됩니다
    • 고속 등급 Wan 3.0 Prime, 원할 때 언제든
    • 실패한 실행은 크레딧을 쓰지 않습니다
    • 크레딧을 쓰지 않았다면 7일 환불
    • 두 번 클릭으로 해지 — 가입할 때의 가격은 그대로 잠깁니다

    위 두 줄 아래에 있는 것은 전부 $12.90짜리 이 플랜에 들어 있습니다. 더 큰 플랜이 사는 것은 초와 테이크이지, 더 좋은 모델이 아닙니다.

    한눈에

    월 클립 수
    480P 5초로 ≈ 12편
    생성당 테이크 수
    2
    1달러당 크레딧
    기준선
    환불 기간
    7일
  • 대부분 여기로 옵니다
    Pro

    근무일마다 완성된 클립 하나씩, 각각 대안 세 개까지. 480P로 초안 잡고 1080P로 마무리하는 방식을, 한 주 분량으로 맞춘 크기입니다.

    $39.90/ 월$49.90

    연 $478.80 청구

    언제든 해지

    월 2,240 크레딧 · ≈ 56편

    480P 5초 기준 · 720P면 28편 · 1080P면 14편

    플랜 크레딧은 월말에 소멸합니다

    • 월 2,240 크레딧 — Starter의 3.5배
    • 월 완성 클립 ≈ 56편, 1080P로만 하면 14편
    • 생성 한 번에 같은 프롬프트 테이크 4개 — 다시 돌리는 대신 골라 쓰세요테이크 2배
    • Starter보다 1달러당 크레딧 +13%더 나은 단가
    • 같은 주 안에 480P로 초안 잡고 1080P로 마무리할 여유
    • 모든 해상도 — 480P, 720P, 1080P
    • 모든 길이 — 한 번에 2초부터 30초까지
    • 모든 입력 — 텍스트, 사진, 레퍼런스, 문서, 웹페이지
    • 소리는 같은 패스에서, 워터마크 없음
    • 상업적 이용 포함 — 공개하고, 팔고, 청구해도 됩니다
    • 고속 등급 Wan 3.0 Prime, 원할 때 언제든
    • 실패한 실행은 크레딧을 쓰지 않습니다
    • 크레딧을 쓰지 않았다면 7일 환불
    • 두 번 클릭으로 해지 — 가입할 때의 가격은 그대로 잠깁니다

    Starter에서 올라오며 달라지는 것은 수량과 테이크와 단가입니다. 모델과 해상도와 30초는 이미 당신 것이었습니다.

    한눈에

    월 클립 수
    480P 5초로 ≈ 44편
    생성당 테이크 수
    4
    1달러당 크레딧
    Starter 대비 +21%
    환불 기간
    7일
  • Studio최고 단가

    클라이언트 물량, 그리고 1080P를 아껴 쓰지 않아도 되는 플랜. 월 31편을 최고 해상도로 완성할 수 있고, 저희가 파는 크레딧 중 가장 싼 단가입니다.

    $99.90/ 월$119.90

    연 $1,198.80 청구

    언제든 해지

    월 6,240 크레딧 · ≈ 156편

    480P 5초 기준 · 720P면 78편 · 1080P면 39편

    플랜 크레딧은 월말에 소멸합니다

    • 월 6,240 크레딧 — Starter의 9.75배, Pro의 2.8배13×
    • 월 완성 클립 ≈ 156편, 또는 1080P로 39편
    • 1달러당 크레딧 +26% — 저희가 파는 것 중 가장 좋은 단가최고 단가
    • 480P로 먼저 초안 잡을 필요가 없어질 만큼의 1080P
    • 한 번 실행에 같은 프롬프트 테이크 4개
    • 채널 하나가 아니라 클라이언트 여럿에 맞춘 크기
    • 플랜을 바꾸지 않고 아무 달에나 충전
    • 모든 해상도 — 480P, 720P, 1080P
    • 모든 길이 — 한 번에 2초부터 30초까지
    • 모든 입력 — 텍스트, 사진, 레퍼런스, 문서, 웹페이지
    • 소리는 같은 패스에서, 워터마크 없음
    • 상업적 이용 포함 — 공개하고, 팔고, 청구해도 됩니다
    • 고속 등급 Wan 3.0 Prime, 원할 때 언제든
    • 실패한 실행은 크레딧을 쓰지 않습니다
    • 크레딧을 쓰지 않았다면 7일 환불
    • 두 번 클릭으로 해지 — 가입할 때의 가격은 그대로 잠깁니다

    채널 하나가 아니라 클라이언트 여럿을 위한 플랜입니다. 모든 프롬프트에 테이크 네 개, 아껴 쓰지 않는 1080P, 그리고 잔액을 보지 않고도 한 장면을 다시 찍을 여유.

    한눈에

    월 클립 수
    480P 5초로 ≈ 124편
    1080P로만 하면
    월 ≈ 31편
    1달러당 크레딧
    Starter 대비 +28%
    환불 기간
    7일

질문

Wan 3.0 립싱크 — 사람들이 실제로 들고 오는 질문

얼굴을 올리기 전에 답해 둘 값어치가 있는 것들이고, 숫자는 기능 목록이 아니라 알리바바 자신의 매개변수 표에서 가져왔습니다.

립싱크를 하려면 오디오 파일이 필요한가요?

아니요 — 그러니 찾는 걸 그만두셔도 됩니다. 프롬프트에 말을 따옴표로 적고 화면 속 인물에게 붙이면 — She says: "Two minutes to set up."Wan 3.0이 그림과 같은 패스에서 말소리를 직접 만들고 입을 거기에 맞춰 움직입니다. 사진 한 장과 문장 하나가 입력의 전부입니다. 음성 녹음은 다른 경로이고, 음색이 특정한 것이어야 할 때 씁니다.

서술이 아니라 발화되게 하려면 대사를 어떻게 쓰나요?

따옴표로 감싸고 누군가에게 붙이세요. 알리바바 자신의 프롬프트 공식은 발화 내용을 그것이 실어야 할 감정·톤·억양 옆에 두고, 이 페이지의 모든 데모가 그것을 따릅니다 — She says: "…", 그다음에 연기. 요약만 된 말은 대신 서술되거나 지어집니다. 이 사이트의 프롬프트 도구들은 대사를 중괄호 {like this}로 감싸는데, 대사가 어디서 시작하고 끝나는지 표시하는 같은 일을 합니다.

대사가 발화되는 대신 화면에 찍혀 나왔습니다. 왜인가요?

프롬프트에서 찍지 말라고 한 것이 없기 때문입니다. 이 모델에는 네거티브 프롬프트 칸이 없으므로 제외는 평범한 문장입니다 — "no subtitles, no text overlays"로 닫으면 대사가 오디오로 생성됩니다. Negative prompt: subtitles라고 쓰면 반대가 됩니다. 그 말들이 그릴 것이 됩니다.

사진과 음성 녹음을 함께 올릴 수 있나요?

한 요청에서는 안 됩니다. 첫 프레임으로 못 박은 사진은 프레임 계열에 속하고 오디오 트랙은 레퍼런스 계열에 속하는데, 두 계열은 상호 배타입니다 — 요청은 등급이 낮춰지는 것이 아니라 거절됩니다. 하나를 고르세요. 정확한 시작 프레임에 생성된 목소리를 쓰거나, 녹음한 목소리에 그림을 레퍼런스로 붙이거나.

대사는 얼마나 길 수 있나요?

산 초 수만큼 길 수 있습니다. 프롬프트 칸은 20,000자를 담고 클립은 30 fps로 2초에서 30초를 담으므로, 묶는 것은 시계입니다. 위에 있는 알리바바 자신의 30초 데모는 여섯 대사를 담는데, B롤 박자까지 세면 5초에 짧은 문장 하나쯤입니다. 넘치는 대사는 급해지거나 잘리고, 프롬프트를 아무리 길게 써도 그건 고쳐지지 않습니다 — 대신 초를 더 사세요.

립싱크는 어떤 언어에서 되나요?

생각보다 많고, 증거는 이 페이지 위에 있습니다. 옥상 클립은 가수 한 명이 여덟 언어를 오가는 동안 동기가 유지되는 알리바바 자신의 데모이고, 도장 클립은 대사를 일본어로 돌립니다. 없는 것은 지원되는 발화 언어의 공개 목록과, 음소를 고정하는 매개변수 쪽입니다. 그러니 다른 데서 인용된 구체적인 숫자는 누군가의 짐작으로 다루세요. 필요한 언어로 480P 3초를 돌려 보세요 — 채택본 하나의 아주 일부 값으로 당신 경우에 대한 답이 나옵니다.

한 클립에서 두 사람이 말할 수 있나요?

됩니다. 위의 팟캐스트 클립이 둘이서 열 번 주고받는 것입니다. 화자마다 고유한 이름표와 구별될 만큼의 묘사를 주고, 대사마다 그 화자가 눈에 보이게 하고 있는 무언가에 걸고, 그다음 말해지는 순서대로 대사를 쓰세요. 알리바바의 안내는 대명사가 화자를 뭉갠다고 분명히 적고 있습니다 — "그가 말한다… 그러고 나서 그가 말한다"가 두 인물이 한 목소리로 끝나는 방식입니다.

말소리에 값이 더 붙나요?

아닙니다. 과금은 출력 초와 해상도로만 하므로, 대사가 있는 클립은 같은 클립을 무음으로 만든 것과 정확히 같은 값입니다. 레퍼런스 이미지와 레퍼런스 오디오도 과금되지 않습니다. 청구서에 더해지는 유일한 입력은 레퍼런스 동영상입니다 — 그 초는 요청한 초 위에 출력 요율로 얹혀 과금됩니다.

말하는 동안 그림의 나머지는 가만히 있나요?

그렇게 말했을 때만 그렇습니다. 당신의 사진은 1번 프레임이지 고정된 판이 아닙니다 — 그 뒤는 전부 생성되므로, 프롬프트가 못 박지 않으면 방과 빛과 화면이 흘러갑니다. 위의 알리바바 데모 둘 다 정확히 그 일에 한 문단을 쓰면서 무엇이 똑같이 남아야 하는지 이름을 댑니다. 프롬프트 칸 옆의 외형 고정이 같은 절을 대신 써 줍니다.

말하는 클립을 상업적으로 공개할 수 있나요?

됩니다. 상업적 이용은 모든 유료 플랜에 포함되고, 워터마크도 없고 따로 살 라이선스도 없습니다. 알리바바의 이용 정책과 저희 이용약관에 따릅니다. 한계는 라이선스가 아니라 얼굴입니다. 사진 속 사람과 녹음 속 목소리 둘 다 동의했어야 합니다.

얼굴 하나, 문장 하나

인물 사진을 올리고, 시키고 싶은 대사를 따옴표로 적고, 무엇이 돌아오는지 들어 보세요. Wan 3.0 클립 한 편이 480P에서 최대 3초까지 무료입니다 — 이메일만, 카드 없이. 연기가 상상한 것과 다르더라도, 값은 들지 않았습니다.

wan-3.run 편집팀이 쓰고 관리합니다게시 최종 수정 도구 버전 2026.09.4