Wan 3.0 AI 립싱크
얼굴을 넣고 대사를 따옴표로 적으면 입이 말을 따라갑니다. Wan 3.0 립싱크는 목소리를 그림과 같은 패스에서 만들기 때문에, 먼저 녹음할 오디오 파일도 나중에 할 더빙 작업도 없습니다. 2초에서 30초, 소리는 MP4 안에, 그리고 첫 클립은 값이 들지 않습니다.
알리바바 자신의 Wan 3.0 대사 데모 · 이거 써 보기를 누르면 프롬프트가 들어옵니다
카메라를 보고 · 9:16 · 720P카메라를 보고, 대사 여섯 개 길이
프롬프트에 대사가 들어 있을 때 Wan 3.0이 하는 일
여기 있는 클립은 전부 알리바바가 Wan 3.0을 위해 공개한 데모이고, 각각 그것을 만든 프롬프트와 함께 왔습니다. 목소리는 소리 듣기를, 전체를 이 페이지 맨 위 칸에 넣으려면 프롬프트 사용을 누르세요 — 쓰인 언어 그대로, 전문이 실려 있습니다.
- 1패스그림과 말소리와 입 움직임이 한 번의 생성에
- $0오디오 트랙에 붙는 추가 요금
- wan3.0-video이 띠의 모든 클립 뒤에 있는 모델
레퍼런스카메라를 보고 여섯 대사, 제품은 레퍼런스 이미지에 붙들려
레퍼런스언어를 바꿔 가는 가수 한 명, 여덟 번 모두 유지되는 동기
레퍼런스화자 둘, 일본어, 각자 한 대사씩 겹침 없이
첫 프레임동물 둘의 스틸 한 장이 열 번의 주고받기가 됩니다
- 말
정확한 대사를 따옴표로. 요약하면 모델이 지어낸 대사가 나옵니다.
- 화자
누가 말하는지 못 박으세요 — 나이, 머리, 옷 — 아니면 엉뚱한 입이 움직입니다.
- 카메라
대사가 이어지는 동안 카메라를 얼굴에 두세요.
- 텍스트
자막 없음으로 닫으세요. 아니면 대사가 화면에 찍혀 올 수 있습니다.
간단한 텍스트 프롬프트로 AI 립싱크 영상 만들기
대본 형식도, 타임라인도, 음성 파일도 없습니다. 평범한 문장으로 숏을 설명하고, 인물이 하는 말을 따옴표로 적어 화면 속 사람에게 붙이면, Wan 3.0이 한 번의 요청으로 그림을 생성하고 목소리를 합성하고 거기에 입을 맞춥니다.
Medium A-roll. The woman stands behind the kitchen counter
holding the pink portable blender, speaking naturally to camera.
She says: "I get asked how I make smoothies so quickly."
No subtitles, no text overlays, no UI, no watermark.
- 숏, 카메라, 그리고 누가 말하는지
- 따옴표 안의 대사, 그리고 찍히면 안 되는 것
9:16 · 720P · 30Swan3.0-video · 16:9 · 720P · 14초 · 말소리와 입이 같은 패스에서
위 네 줄은 알리바바 자신의 30초 데모에서 가져온 것이고, 그 데모는 20,000자 한도에 대해 2,484자입니다. 그 여유는 화자와 제품과 제외 항목을 못 박는 데 쓰는 것이지 더 길게 쓰라는 뜻이 아닙니다. 인물 사진을 설명하는 대신 올린다고 해서 대사 자체를 쓰는 법이 달라지지는 않습니다.
립싱크 영상 프롬프트를
AI로 다듬기
잘못 돌아온 실행이 모델 문제인 경우는 거의 없습니다. 그림만 지목하고 연기와 카메라와 자막 규칙은 운에 맡긴 프롬프트일 뿐입니다.
프롬프트 생성기는 시키고 싶은 대사를 받아 그 둘레에 Wan 3.0 프롬프트 한 벌을 돌려줍니다 — 화자를 못 박고, 카메라 움직임 하나에 이름을 붙이고, 소리 층을 순서대로 세우고, 대사를 구분자로 감싸 서술이 아니라 연기가 되게 합니다. 이 모델이 실제로 강제하는 규칙에 결과를 대조하므로, 사람들이 잊는 그 한 절이 크레딧을 쓴 뒤가 아니라 쓰기 전에 붙습니다.
01
시키고 싶은 대사를 적으세요
한 문장이면 시작하기에 충분합니다. 누가 말하고 어디인지는 조각이어도 됩니다.
02
그 둘레로 지어진 프롬프트를 받으세요
화자, 카메라, 소리 층, 그리고 구분자로 감싼 대사를 Wan 3.0이 읽는 순서대로.
03
여기로 보내고 얼굴을 더하세요
프롬프트는 길이와 비율이 이미 맞춰진 채로 이 페이지 맨 위 칸에 도착합니다.
연기가 마음에 들었던 클립이 이미 있나요? 영상에서 프롬프트 추출이 그 대사를 받아 적어 중괄호 안에 넣어 돌려줍니다 — 이 모델이 서술이 아니라 연기하는 그 형태로.
대본에서 영상까지, 온전한 AI 작업 흐름
같은 엔드포인트로 들어가는 문이 넷입니다. 손에 든 것이 무엇이든 — 대본 한 문단, 자료 한 벌, 인물 사진 한 장, 이미 생성해 둔 클립 — 거기서 말하는 테이크까지 가는 길이 있고, 어느 길도 음성 도구를 따로 붙일 필요가 없습니다.
위의 것들은 모두 같은 곳에 도착합니다 — 내 작업물에 실행마다 MP4와 프롬프트와 작업 ID가 남으므로, 마음에 들었던 테이크는 다시 만들지 않고 다시 열면 됩니다.
Wan 3.0으로
사진에 립싱크 입히는 법
사람들이 틀리는 단계는 세 번째입니다. 모델이 짐작할 수 없는 말을 쓰는 대신, 모델이 이미 볼 수 있는 그림을 설명하는 것.
얼굴을 끌어다 놓으세요
검사는 브라우저 안에서 즉시 돕니다. 괜찮은 파일은 초록 줄로 나오고, 아닌 파일은 돈을 쓰기 전에 고칠 곳을 짚어 줍니다.
무료로 검사대사를 따옴표로 적고, 누가 말하는지 밝히세요
정확한 말을 따옴표 안에, 화면 속 인물에게 붙여서. 요약하면 — "그녀가 안심시키는 말을 한다" — 모델이 지어낸 대사가 돌아옵니다.
정확한 말만"no subtitles"로 닫으세요
네거티브 프롬프트 칸이 없으므로, 대사를 찍지 말라는 지시도 다른 문장과 똑같은 문장입니다. 한 절이면 되고, 실행 한 번을 아낍니다.
한 절길이와 해상도를 정하고 생성하세요
대사에 필요한 초를 먼저 사세요. 말소리와 룸톤과 입 움직임이 이미 들어 있는 MP4 하나가 돌아옵니다.
1080P까지
짧은 클립은 90초쯤 걸리고, 도는 동안 탭을 닫아도 됩니다. 올린 사진은 절대 수정되지 않습니다 — 결과물은 새 파일입니다.
당신의 사진이 1번 프레임입니다.
목소리는 올리는 것이 아니라 쓰는 것입니다.
이 분야의 도구는 대개 그림과 오디오 파일을 받아 입을 거기에 맞춥니다. 이것은 그림과 문장을 받습니다.

프레임 001 · 당신의 얼굴
여기서부터는 말하고, 맞춰집니다
Wan 3.0 립싱크는 당신의 사진을 말 그대로 첫 프레임으로 넣고 거기서부터 2초에서 30초를 앞으로 생성합니다. 30 fps로 480P, 720P 또는 1080P입니다. 따옴표로 적은 말은 그 클립 자신의 오디오 트랙에 말소리로 돌아오고 입이 거기에 맞춰 움직입니다. 그림과 소리를 둘로 나눠 붙이는 것이 아니라 같은 패스에서 생성하기 때문입니다.
- 당신의 사진이 첫 프레임
- 001
- 당신이 준비해야 하는 오디오 파일
- 0
- 어떤 정수 초든
- 2–30초
- 돌아오는 MP4, 소리는 이미 그 안에
- 1
당신의 사진이 첫 프레임
당신이 준비해야 하는 오디오 파일
어떤 정수 초든
돌아오는 MP4, 소리는 이미 그 안에
- 생성 전에 거치는 TTS 단계 없음
- 생성 후에 하는 더빙 작업 없음
- 입을 위해 따로 라이선스할 두 번째 모델 없음
대사가 말소리가 되느냐
화면에 찍히느냐를 가르는 것
문장 둘이 대사가 들리느냐 읽히느냐를 정합니다. 하나는 정확한 말을 화자의 입에 넣고, 다른 하나는 그 말을 그림 밖에 둡니다. 둘 중 하나를 빠뜨리면 실패가 완성되고 과금된 동영상으로 도착합니다.
맞춰진 대사의 해부
말소리와 그림 · 한 패스
열 번 주고받기 · 720P · 30s입이 제대로 움직이려면 필요한 것
3
- 정확한 말, 요약이 아니라 따옴표로
- 못 박을 수 있을 만큼 자세히 묘사된 화자
- 말하는 동안 그 얼굴에 놓인 카메라
사람들이 놓치는 규칙
네거티브 프롬프트 칸이 없으므로 "이건 찍지 마세요"도 프롬프트 안의 여느 문장과 같은 문장입니다. 빼 두면 모델은 당신의 대사를 말하는 동시에 화면에 그릴 것으로 다뤄도 됩니다 — 위에 실린 알리바바 자신의 30초 데모가 바로 그 지시로 끝나는 이유가 이것입니다.
no subtitles, no text overlays맞음Negative prompt: subtitles틀림
네거티브 프롬프트처럼 생긴 것은 그릴 말이 더 있는 것으로 읽히고, 요청은 그대로 성공합니다 — 그래서 실패가 화면 어딘가에 "Negative prompt"라는 글자가 박힌 완성된 클립으로 도착합니다.
중괄호도 됩니다 — 이 사이트의 프롬프트 도구들이 내보내는 것이 {like this}입니다. 모델이 실제로 찾는 것은 눈에 보이는 화자가 붙은, 구분자로 감싼 대사이고, 알리바바가 공개한 프롬프트들은 거기에 따옴표를 씁니다. 텍스트로 동영상 만들기에 소리 네 층과 그것들을 부르는 순서가 있습니다.
인물 사진을 검사하세요
크레딧을 쓰기 전에
Wan 3.0이 읽지 못할 얼굴은 생성을 날리는 가장 성가신 방법입니다. 대기열 앞이 아니라 뒤에서 알게 되기 때문입니다. 사진을 여기에 끌어다 놓으면 실제 한도에 대조해 검사합니다 — 형식, 파일 크기, 치수, 비율, 투명도 — 그리고 어느 줄이 걸리든 고칠 방법을 짚어 줍니다. 아무것도 올라가지 않습니다. 검사는 브라우저 안에서 돕니다.
JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 240–8,000px · ratio ≤8:1
얼굴 하나가, 입이 그림에서 가장 작은 것이 되지 않게 잡혀 있으면 동기가 쓸 재료가 가장 많습니다. 검사기는 모델을 건드리지 않으므로, 애초에 읽히지 않았을 인물 사진을 알아내는 데는 값이 들지 않습니다.
Wan 3.0 립싱크 한도
— 인물 사진, 클립, 그리고 목소리
이 줄 중 다섯은 사진을 다스리고, 둘은 나오는 것을 다스리며, 마지막 하나가 아무도 예상하지 못하는 거절을 만듭니다. 이 페이지 맨 위의 업로드 칸이 돈을 쓰기 전에 이미지 줄들을 검사합니다.
고정된 첫 프레임과 음성 녹음은 함께 갈 수 없습니다. 프레임은 입력의 한 계열이고 레퍼런스는 다른 계열입니다. 둘 다 실은 요청은 등급이 낮춰지는 것이 아니라 그대로 거절되므로, 선택은 올리기 전에 이루어집니다.
대사 자체에는 별도의 칸도 별도의 한도도 없습니다. 나머지와 함께 프롬프트 안에 살고, 프롬프트는 20,000자를 담습니다. 발화되는 대사를 묶는 것은 글자 수가 아니라 시계입니다 — 짧은 문장 하나에 화면 시간 2~3초쯤이므로, 4초짜리 클립 안의 열다섯 단어짜리 대사는 급해지거나 잘립니다. 해상도를 사기 전에 대사에 필요한 초부터 사세요.
Wan 3.0 립싱크 클립 한 편의 값
값은 길이와 해상도가 정합니다. 말소리는 아닙니다. 오디오 스위치는 돌아오는 것을 바꾸지 값을 바꾸지 않고, 레퍼런스 오디오는 아예 과금되지 않습니다. 실패한 실행은 자동으로 환급되고, 위의 검사기가 피할 수 있는 실패 대부분을 애초에 모델까지 가지 않게 막습니다.
과금 방식
- 과금 기준
- 출력 초
- 말소리, 레퍼런스 오디오
- 과금 없음
- 첫 클립
- 무료 · 480P
연기가 자리를 잡을 때까지 480P로 대사를 다듬고, 그다음 720P나 1080P로 한 번 쓰세요 — 실행 사이에 인물 사진을 다시 검사할 필요는 없습니다. 요금제 전체.
어느 쪽이든 월 크레딧은 같습니다
Wan 3.0 립싱크 — 사람들이 실제로 들고 오는 질문
얼굴을 올리기 전에 답해 둘 값어치가 있는 것들이고, 숫자는 기능 목록이 아니라 알리바바 자신의 매개변수 표에서 가져왔습니다.
립싱크를 하려면 오디오 파일이 필요한가요?
She says: "Two minutes to set up." — Wan 3.0이 그림과 같은 패스에서 말소리를 직접 만들고 입을 거기에 맞춰 움직입니다. 사진 한 장과 문장 하나가 입력의 전부입니다. 음성 녹음은 다른 경로이고, 음색이 특정한 것이어야 할 때 씁니다.서술이 아니라 발화되게 하려면 대사를 어떻게 쓰나요?
She says: "…", 그다음에 연기. 요약만 된 말은 대신 서술되거나 지어집니다. 이 사이트의 프롬프트 도구들은 대사를 중괄호 {like this}로 감싸는데, 대사가 어디서 시작하고 끝나는지 표시하는 같은 일을 합니다.대사가 발화되는 대신 화면에 찍혀 나왔습니다. 왜인가요?
Negative prompt: subtitles라고 쓰면 반대가 됩니다. 그 말들이 그릴 것이 됩니다.사진과 음성 녹음을 함께 올릴 수 있나요?
대사는 얼마나 길 수 있나요?
립싱크는 어떤 언어에서 되나요?
한 클립에서 두 사람이 말할 수 있나요?
말소리에 값이 더 붙나요?
말하는 동안 그림의 나머지는 가만히 있나요?
누구의 얼굴과 누구의 목소리를 쓸 수 있나요?
말하는 클립을 상업적으로 공개할 수 있나요?
얼굴 하나, 문장 하나
인물 사진을 올리고, 시키고 싶은 대사를 따옴표로 적고, 무엇이 돌아오는지 들어 보세요. Wan 3.0 클립 한 편이 480P에서 최대 3초까지 무료입니다 — 이메일만, 카드 없이. 연기가 상상한 것과 다르더라도, 값은 들지 않았습니다.
wan-3.run 편집팀이 쓰고 관리합니다게시 최종 수정 도구 버전 2026.09.4




