AI 말하는 사진 만들기

사진 한 장과 음성을 올리면 AI 말하는 사진이 그 얼굴이 모든 말을 하는 영상으로 만듭니다.

  • 사진 한 장이면 충분
  • 모든 음성 트랙 지원
  • 최대 1080p
  • 초 단위 요금
720p · 8/초

오디오와 같은 길이의 MP4를 받게 됩니다. 짧은 클립은 대부분 3~5분이 걸립니다.

AI 말하는 사진 예시

저희가 직접 테스트한 결과입니다. 인물 사진 한 장과 대사 한 줄로 말하는 영상을 만들었습니다. 소리를 켜 주세요.

말하는 사진의 원본이 된 AI 생성 인물 사진
원본 사진
말하는 사진

그가 영어로 말하는 대사: “Hi there. A minute ago this clip was silent. Now every word I say matches my lips.”

스탠다드 · 음성 6.5초 · 56 크레딧 · 약 3.5분

같은 사진, 같은 대사, 두 가지 방법

같은 남성이 같은 대사를 두 번 말하게 했습니다. 한 번은 AI 말하는 사진으로, 한 번은 사진을 움직인 뒤 립싱크로 만들었습니다.

AI 말하는 사진

1단계

사진과 오디오를 넣으면 말하는 영상이 나옵니다. 한 단계로 끝나며, 말에 맞춰 머리와 얼굴이 움직입니다.

56 크레딧

움직인 뒤 립싱크

2단계

먼저 사진으로 8초짜리 무음 클립을 만들고, 대사에 맞춰 입을 다시 그립니다. 두 단계이며, 첫 단계에서 움직임을 고를 수 있습니다.

30 + 64 = 94 크레딧

말하는 인물 사진 하나만 필요하다면 AI 말하는 사진이 더 싸고 간단합니다. 특정한 움직임, 더 긴 샷, 얼굴 주변의 장면이 필요하면 먼저 사진을 움직이세요.

AI 말하는 사진이란?

AI 말하는 사진은 정지 이미지 한 장과 오디오 트랙으로 만든 영상입니다. 사진 속 얼굴이 말에 맞춰 입을 열고, 눈을 깜빡이고, 고개를 움직입니다. 인물 사진과 녹음한 목소리를 주면 그 사람이 말하는 모든 프레임을 그려 냅니다.

카메라 없이 목소리에 얼굴을 입힐 수 있습니다. 제품 설명, 강의 인트로, 가족사진, AI 캐릭터가 하루 걸리는 촬영 대신 몇 분 만에 말을 합니다.

AI 말하는 사진의 작동 원리

모델은 오디오를 읽고 소리마다 입 모양을 계산하며, 말할 때 따라오는 작은 움직임도 함께 만듭니다. 강조하는 단어에서 고개를 끄덕이고, 질문할 때 눈썹을 올리고, 구절 사이에 눈을 깜빡이는 식입니다. 그런 다음 사진을 바탕으로 프레임을 하나씩 그리며, 표정이 바뀌는 동안 얼굴, 머리카락, 옷은 그대로 유지합니다.

유지되는 것

인물의 정체성, 헤어스타일, 옷차림, 배경, 사진의 구도.

더해지는 것

말에 맞춘 입술 움직임, 자연스러운 눈 깜빡임, 작은 머리와 어깨 움직임, 그리고 사운드트랙이 되는 내 오디오.

3단계로 사진을 말하게 하는 방법

AI 말하는 사진은 모두 브라우저에서 진행됩니다. 카메라도 편집 프로그램도 필요 없습니다.

01

인물 사진 업로드

카메라를 보는 얼굴 하나가 담긴 JPG 또는 PNG, 각 변 최소 300픽셀.

02

음성 추가

MP3, WAV, M4A 또는 AAC 녹음. 스탠다드와 HD는 최대 15초, 시네마틱은 최대 30초.

MP4
03

화질 선택 후 생성

화질을 고르고 동의 체크박스를 선택한 뒤 '생성하기'를 누르세요. 짧은 클립은 대부분 3~5분이면 완성됩니다.

스탠다드, HD, 시네마틱: 어떤 화질을 고를까

모든 화질에 같은 사진과 오디오를 씁니다. 차이는 선명도, 음성 길이, 움직임이 얼마나 실감 나는지입니다.

스탠다드

초당 8 크레딧

출력
720p
최대 오디오 길이
15초

SNS 게시물, 초안, 빠른 테스트. 위 예시가 스탠다드입니다.

HD

초당 16 크레딧

출력
1080p
최대 오디오 길이
15초

진행자 영상, 광고, 데스크톱 전체 화면으로 보여 줄 모든 것.

시네마틱

초당 27 크레딧

출력
1080p
최대 오디오 길이
30초

긴 연설, 표현력 있는 전달, 가장 실감 나는 머리와 몸 움직임.

좋은 사진의 조건

AI 말하는 사진은 보이는 것만 움직일 수 있습니다. 다음 다섯 가지가 결과를 가장 크게 좌우합니다.

01

얼굴은 카메라 쪽으로

정면이나 살짝 돌린 얼굴. 옆모습은 입이 반만 보입니다.

이유

모델이 단어마다 입 모양을 만들려면 양쪽 입꼬리가 필요합니다.

02

다물고 편안한 입

무표정이나 옅은 미소여야 모델이 입을 자연스럽게 열 여지가 생깁니다.

이유

사진 속 활짝 웃는 입이나 벌린 입은 모든 단어와 충돌합니다.

03

선명하고 밝게

얼굴에 고른 조명, 짙은 그림자 없이, 각 변 최소 300픽셀.

이유

눈과 입술 주변의 디테일이 움직임을 자연스럽게 만듭니다.

04

한 사람만

단체 사진은 말하게 할 얼굴 하나만 남기고 자르세요.

이유

얼굴이 여러 개면 엉뚱한 사람이 말할 수 있습니다.

05

얼굴 앞을 가리지 않기

손, 마이크, 선글라스, 머리카락이 입을 가리지 않게 하세요.

이유

가려진 부분은 제대로 그려지지 않거나 아예 그려지지 않습니다.

오디오 준비 방법

영상 길이는 오디오와 정확히 같고, 그 초만큼 비용을 냅니다. 조금만 준비하면 크레딧을 아낄 수 있습니다.

  1. 1

    무음 잘라 내기

    앞뒤의 조용한 구간을 잘라 내세요. 말하는 구간과 같은 비용이 듭니다.

  2. 2

    선명한 목소리 하나

    조용한 방에서 마이크 가까이 녹음하세요. 배경 음악이나 다른 사람 목소리가 있으면 입술이 엉뚱한 소리를 따라갈 수 있습니다.

  3. 3

    자연스러운 쉼이 도움이 됩니다

    문장 사이의 짧은 쉼은 얼굴이 눈을 깜빡이고 원래대로 돌아올 시간을 주어 더 사람처럼 보입니다.

  4. 4

    어떤 언어든 가능

    입은 단어가 아니라 소리를 따라가므로 어떤 언어나 억양이든 괜찮습니다.

AI 아바타, 립싱크, 네이티브 음성 영상 중 무엇을 쓸까?

화면 속 인물이 내 대사를 말하게 하는 방법은 세 가지입니다. 무엇으로 시작하는지에 따라 고르세요.

AI 말하는 사진

시작 재료
사진 한 장 + 오디오
적합한 용도
영상이 없을 때의 진행자, 아바타, 캐릭터
주의할 점
머리와 어깨만 움직이고 배경은 고정

Imgveo 가격

스탠다드 5초에 40 크레딧

AI 립싱크

시작 재료
영상 + 오디오
적합한 용도
이미 있는 영상의 더빙과 대사 수정
주의할 점
영상에 선명한 얼굴이 필요

Imgveo 가격

5초 클립에 40 크레딧

네이티브 음성 영상

시작 재료
대사가 들어간 텍스트 프롬프트
적합한 용도
화면과 목소리를 함께 생성하는 새 장면
주의할 점
정확한 얼굴이나 목소리는 직접 정할 수 없음

Imgveo 가격

사운드 포함 8초 클립 30 크레딧부터

가격은 실시간 가격표에서 가져옵니다.

AI 말하는 사진 활용 사례

슬라이드의 글자보다 얼굴이 말하는 편이 더 잘 전달되는 모든 곳에 쓸 수 있습니다.

01

진행자와 설명 영상

제품 페이지, 강의, 온보딩에 말을 건네는 친근한 얼굴을 더하세요.

이렇게 해 보세요

모든 영상에 같은 인물 사진을 쓰면 시청자가 진행자를 알아봅니다.

02

AI 캐릭터

생성한 캐릭터가 자기소개를 하고, 이야기를 들려주고, 팬에게 답하게 하세요.

이렇게 해 보세요

예시처럼 카메라를 보고 입을 다문 캐릭터를 생성하세요.

03

가족사진

가족이 녹음한 메시지로 오래된 인물 사진에 생기를 불어넣으세요.

이렇게 해 보세요

사진을 선명하게 스캔하고 업로드 전에 얼굴 하나만 남기고 자르세요.

04

다국어 메시지

같은 메시지를 여러 언어로 녹음하고 모두 한 장의 인물 사진으로 만드세요.

이렇게 해 보세요

녹음 길이를 비슷하게 맞추면 영상들이 일관돼 보입니다.

AI 말하는 사진이 할 수 없는 것

크레딧을 쓰기 전에 무엇을 기대할 수 있는지 솔직하게 알려 드립니다.

전신 동작

얼굴, 머리, 어깨가 움직입니다. 걷기, 손짓, 카메라 이동은 동영상 모델을 쓰세요.

옆모습과 가려진 입

입이 반쯤 가려지면 움직임이 어색해집니다. 정면 사진을 쓰세요.

아주 긴 연설

스탠다드와 HD는 최대 15초, 시네마틱은 최대 30초입니다. 긴 원고는 여러 클립으로 나누세요.

다른 사람의 얼굴

그 얼굴과 목소리를 사용할 권리가 있어야 합니다. 규칙을 어기는 콘텐츠는 차단합니다.

형식, 제한, 가격

AI 말하는 사진이 받는 파일, 돌려주는 결과, 드는 비용입니다.

입력

사진: JPG 또는 PNG, 최대 10 MB, 최소 300 px, 가로세로 비율 2.5 대 1 이내. 오디오: MP3, WAV, M4A 또는 AAC, 최대 10 MB.

출력

오디오와 같은 길이의 MP4로, 내 음성이 사운드트랙이 되며 스탠다드는 720p, HD와 시네마틱은 1080p입니다.

가격

오디오 1초당 8, 16 또는 27 크레딧이며, 초 단위로 반올림됩니다. 유료 요금제 전용입니다. 실패한 작업은 환불됩니다.

길이별 가격

오디오 길이스탠다드HD시네마틱
5초4080135
10초80160270
15초120240405
30초——810

동의와 책임 있는 사용

말하는 사진은 누구든 어떤 말이든 하는 것처럼 보이게 만들 수 있으므로, 먼저 허락을 확인합니다. 매번 실행하기 전에 그 얼굴과 목소리를 사용할 권리가 있음을 확인해야 하며, 모든 사진은 검토를 거칩니다.

  • 본인의 얼굴, 동의한 사람, 또는 직접 생성한 캐릭터를 사용하세요.
  • 공인, 미성년자, 일반인이 하지 않은 말을 한 것처럼 보이게 만들지 마세요.
  • 플랫폼에서 요구하는 경우 말하는 사진 영상이 AI로 만든 것임을 표시하세요.

AI 말하는 사진 FAQ

모든 AI 모델을 한곳에서 사용하고 싶으신가요?

Imgveo Studio를 열면 이 도구를 비롯한 모든 AI 동영상·이미지 모델을 하나의 작업 공간과 하나의 크레딧으로 사용할 수 있습니다.

Studio에서 열기

다른 동영상 도구

목소리를 입힌 뒤 한 단계 더 나아가 보세요.

내 사진이 말하게 하세요

인물 사진과 음성을 올리면, 나머지는 AI 말하는 사진 메이커가 몇 분 안에 처리합니다.