AI 말하는 사진 만들기
사진 한 장과 음성을 올리면 AI 말하는 사진이 그 얼굴이 모든 말을 하는 영상으로 만듭니다.
- 사진 한 장이면 충분
- 모든 음성 트랙 지원
- 최대 1080p
- 초 단위 요금
오디오와 같은 길이의 MP4를 받게 됩니다. 짧은 클립은 대부분 3~5분이 걸립니다.
AI 말하는 사진 예시
저희가 직접 테스트한 결과입니다. 인물 사진 한 장과 대사 한 줄로 말하는 영상을 만들었습니다. 소리를 켜 주세요.

그가 영어로 말하는 대사: “Hi there. A minute ago this clip was silent. Now every word I say matches my lips.”
스탠다드 · 음성 6.5초 · 56 크레딧 · 약 3.5분
같은 사진, 같은 대사, 두 가지 방법
같은 남성이 같은 대사를 두 번 말하게 했습니다. 한 번은 AI 말하는 사진으로, 한 번은 사진을 움직인 뒤 립싱크로 만들었습니다.
AI 말하는 사진
1단계사진과 오디오를 넣으면 말하는 영상이 나옵니다. 한 단계로 끝나며, 말에 맞춰 머리와 얼굴이 움직입니다.
56 크레딧
움직인 뒤 립싱크
2단계먼저 사진으로 8초짜리 무음 클립을 만들고, 대사에 맞춰 입을 다시 그립니다. 두 단계이며, 첫 단계에서 움직임을 고를 수 있습니다.
30 + 64 = 94 크레딧
말하는 인물 사진 하나만 필요하다면 AI 말하는 사진이 더 싸고 간단합니다. 특정한 움직임, 더 긴 샷, 얼굴 주변의 장면이 필요하면 먼저 사진을 움직이세요.
AI 말하는 사진이란?
AI 말하는 사진은 정지 이미지 한 장과 오디오 트랙으로 만든 영상입니다. 사진 속 얼굴이 말에 맞춰 입을 열고, 눈을 깜빡이고, 고개를 움직입니다. 인물 사진과 녹음한 목소리를 주면 그 사람이 말하는 모든 프레임을 그려 냅니다.
카메라 없이 목소리에 얼굴을 입힐 수 있습니다. 제품 설명, 강의 인트로, 가족사진, AI 캐릭터가 하루 걸리는 촬영 대신 몇 분 만에 말을 합니다.
AI 말하는 사진의 작동 원리
모델은 오디오를 읽고 소리마다 입 모양을 계산하며, 말할 때 따라오는 작은 움직임도 함께 만듭니다. 강조하는 단어에서 고개를 끄덕이고, 질문할 때 눈썹을 올리고, 구절 사이에 눈을 깜빡이는 식입니다. 그런 다음 사진을 바탕으로 프레임을 하나씩 그리며, 표정이 바뀌는 동안 얼굴, 머리카락, 옷은 그대로 유지합니다.
유지되는 것
인물의 정체성, 헤어스타일, 옷차림, 배경, 사진의 구도.
더해지는 것
말에 맞춘 입술 움직임, 자연스러운 눈 깜빡임, 작은 머리와 어깨 움직임, 그리고 사운드트랙이 되는 내 오디오.
3단계로 사진을 말하게 하는 방법
AI 말하는 사진은 모두 브라우저에서 진행됩니다. 카메라도 편집 프로그램도 필요 없습니다.
인물 사진 업로드
카메라를 보는 얼굴 하나가 담긴 JPG 또는 PNG, 각 변 최소 300픽셀.
음성 추가
MP3, WAV, M4A 또는 AAC 녹음. 스탠다드와 HD는 최대 15초, 시네마틱은 최대 30초.
화질 선택 후 생성
화질을 고르고 동의 체크박스를 선택한 뒤 '생성하기'를 누르세요. 짧은 클립은 대부분 3~5분이면 완성됩니다.
스탠다드, HD, 시네마틱: 어떤 화질을 고를까
모든 화질에 같은 사진과 오디오를 씁니다. 차이는 선명도, 음성 길이, 움직임이 얼마나 실감 나는지입니다.
스탠다드
초당 8 크레딧
- 출력
- 720p
- 최대 오디오 길이
- 15초
SNS 게시물, 초안, 빠른 테스트. 위 예시가 스탠다드입니다.
HD
초당 16 크레딧
- 출력
- 1080p
- 최대 오디오 길이
- 15초
진행자 영상, 광고, 데스크톱 전체 화면으로 보여 줄 모든 것.
시네마틱
초당 27 크레딧
- 출력
- 1080p
- 최대 오디오 길이
- 30초
긴 연설, 표현력 있는 전달, 가장 실감 나는 머리와 몸 움직임.
좋은 사진의 조건
AI 말하는 사진은 보이는 것만 움직일 수 있습니다. 다음 다섯 가지가 결과를 가장 크게 좌우합니다.
얼굴은 카메라 쪽으로
정면이나 살짝 돌린 얼굴. 옆모습은 입이 반만 보입니다.
이유
모델이 단어마다 입 모양을 만들려면 양쪽 입꼬리가 필요합니다.
다물고 편안한 입
무표정이나 옅은 미소여야 모델이 입을 자연스럽게 열 여지가 생깁니다.
이유
사진 속 활짝 웃는 입이나 벌린 입은 모든 단어와 충돌합니다.
선명하고 밝게
얼굴에 고른 조명, 짙은 그림자 없이, 각 변 최소 300픽셀.
이유
눈과 입술 주변의 디테일이 움직임을 자연스럽게 만듭니다.
한 사람만
단체 사진은 말하게 할 얼굴 하나만 남기고 자르세요.
이유
얼굴이 여러 개면 엉뚱한 사람이 말할 수 있습니다.
얼굴 앞을 가리지 않기
손, 마이크, 선글라스, 머리카락이 입을 가리지 않게 하세요.
이유
가려진 부분은 제대로 그려지지 않거나 아예 그려지지 않습니다.
오디오 준비 방법
영상 길이는 오디오와 정확히 같고, 그 초만큼 비용을 냅니다. 조금만 준비하면 크레딧을 아낄 수 있습니다.
- 1
무음 잘라 내기
앞뒤의 조용한 구간을 잘라 내세요. 말하는 구간과 같은 비용이 듭니다.
- 2
선명한 목소리 하나
조용한 방에서 마이크 가까이 녹음하세요. 배경 음악이나 다른 사람 목소리가 있으면 입술이 엉뚱한 소리를 따라갈 수 있습니다.
- 3
자연스러운 쉼이 도움이 됩니다
문장 사이의 짧은 쉼은 얼굴이 눈을 깜빡이고 원래대로 돌아올 시간을 주어 더 사람처럼 보입니다.
- 4
어떤 언어든 가능
입은 단어가 아니라 소리를 따라가므로 어떤 언어나 억양이든 괜찮습니다.
AI 아바타, 립싱크, 네이티브 음성 영상 중 무엇을 쓸까?
화면 속 인물이 내 대사를 말하게 하는 방법은 세 가지입니다. 무엇으로 시작하는지에 따라 고르세요.
AI 말하는 사진
- 시작 재료
- 사진 한 장 + 오디오
- 적합한 용도
- 영상이 없을 때의 진행자, 아바타, 캐릭터
- 주의할 점
- 머리와 어깨만 움직이고 배경은 고정
Imgveo 가격
스탠다드 5초에 40 크레딧
AI 립싱크
- 시작 재료
- 영상 + 오디오
- 적합한 용도
- 이미 있는 영상의 더빙과 대사 수정
- 주의할 점
- 영상에 선명한 얼굴이 필요
Imgveo 가격
5초 클립에 40 크레딧
네이티브 음성 영상
- 시작 재료
- 대사가 들어간 텍스트 프롬프트
- 적합한 용도
- 화면과 목소리를 함께 생성하는 새 장면
- 주의할 점
- 정확한 얼굴이나 목소리는 직접 정할 수 없음
Imgveo 가격
사운드 포함 8초 클립 30 크레딧부터
가격은 실시간 가격표에서 가져옵니다.
AI 말하는 사진 활용 사례
슬라이드의 글자보다 얼굴이 말하는 편이 더 잘 전달되는 모든 곳에 쓸 수 있습니다.
진행자와 설명 영상
제품 페이지, 강의, 온보딩에 말을 건네는 친근한 얼굴을 더하세요.
이렇게 해 보세요
모든 영상에 같은 인물 사진을 쓰면 시청자가 진행자를 알아봅니다.
AI 캐릭터
생성한 캐릭터가 자기소개를 하고, 이야기를 들려주고, 팬에게 답하게 하세요.
이렇게 해 보세요
예시처럼 카메라를 보고 입을 다문 캐릭터를 생성하세요.
가족사진
가족이 녹음한 메시지로 오래된 인물 사진에 생기를 불어넣으세요.
이렇게 해 보세요
사진을 선명하게 스캔하고 업로드 전에 얼굴 하나만 남기고 자르세요.
다국어 메시지
같은 메시지를 여러 언어로 녹음하고 모두 한 장의 인물 사진으로 만드세요.
이렇게 해 보세요
녹음 길이를 비슷하게 맞추면 영상들이 일관돼 보입니다.
AI 말하는 사진이 할 수 없는 것
크레딧을 쓰기 전에 무엇을 기대할 수 있는지 솔직하게 알려 드립니다.
전신 동작
얼굴, 머리, 어깨가 움직입니다. 걷기, 손짓, 카메라 이동은 동영상 모델을 쓰세요.
옆모습과 가려진 입
입이 반쯤 가려지면 움직임이 어색해집니다. 정면 사진을 쓰세요.
아주 긴 연설
스탠다드와 HD는 최대 15초, 시네마틱은 최대 30초입니다. 긴 원고는 여러 클립으로 나누세요.
다른 사람의 얼굴
그 얼굴과 목소리를 사용할 권리가 있어야 합니다. 규칙을 어기는 콘텐츠는 차단합니다.
형식, 제한, 가격
AI 말하는 사진이 받는 파일, 돌려주는 결과, 드는 비용입니다.
입력
사진: JPG 또는 PNG, 최대 10 MB, 최소 300 px, 가로세로 비율 2.5 대 1 이내. 오디오: MP3, WAV, M4A 또는 AAC, 최대 10 MB.
출력
오디오와 같은 길이의 MP4로, 내 음성이 사운드트랙이 되며 스탠다드는 720p, HD와 시네마틱은 1080p입니다.
가격
오디오 1초당 8, 16 또는 27 크레딧이며, 초 단위로 반올림됩니다. 유료 요금제 전용입니다. 실패한 작업은 환불됩니다.
길이별 가격
| 오디오 길이 | 스탠다드 | HD | 시네마틱 |
|---|---|---|---|
| 5초 | 40 | 80 | 135 |
| 10초 | 80 | 160 | 270 |
| 15초 | 120 | 240 | 405 |
| 30초 | — | — | 810 |
동의와 책임 있는 사용
말하는 사진은 누구든 어떤 말이든 하는 것처럼 보이게 만들 수 있으므로, 먼저 허락을 확인합니다. 매번 실행하기 전에 그 얼굴과 목소리를 사용할 권리가 있음을 확인해야 하며, 모든 사진은 검토를 거칩니다.
- 본인의 얼굴, 동의한 사람, 또는 직접 생성한 캐릭터를 사용하세요.
- 공인, 미성년자, 일반인이 하지 않은 말을 한 것처럼 보이게 만들지 마세요.
- 플랫폼에서 요구하는 경우 말하는 사진 영상이 AI로 만든 것임을 표시하세요.
AI 말하는 사진 FAQ
모든 AI 모델을 한곳에서 사용하고 싶으신가요?
Imgveo Studio를 열면 이 도구를 비롯한 모든 AI 동영상·이미지 모델을 하나의 작업 공간과 하나의 크레딧으로 사용할 수 있습니다.
다른 동영상 도구
목소리를 입힌 뒤 한 단계 더 나아가 보세요.
내 사진이 말하게 하세요
인물 사진과 음성을 올리면, 나머지는 AI 말하는 사진 메이커가 몇 분 안에 처리합니다.