在藍紫色光線下的人物肖像特寫,象徵 AI 肖像動畫技術

← INSIGHTS & PERSPECTIVES | 機器學習

EchoMimic:人物圖片轉影片的開源模型,安裝與使用教學

EchoMimic 是一款開源的 AI 肖像動畫模型,只要一張人物照片搭配一段音檔,就能生成逼真的說話影片。本文介紹它的工作原理,並附上 CUDA、PyTorch、FFmpeg 環境安裝與推論的完整教學。

EchoMimic 是一款開源 AI 工具,可以將一張人物圖片轉換為逼真的說話影片。它採用創新的肖像圖像動畫(portrait animation)技術,透過組合音頻信號和面部關鍵點,生成生動自然的視頻。這篇文章會說明它的工作原理,並整理我在 Windows 上安裝與執行的完整步驟。

EchoMimic 是什麼?它如何把照片變成說話影片?

EchoMimic 的核心是「音頻驅動的肖像動畫」:輸入一張靜態人物照與一段語音,模型就會讓照片中的人物開口說話。它的工作原理可以拆成四個步驟:

  1. 首先,需要將人物圖片和音頻輸入到模型中。
  2. 模型會提取音頻中的音素,以及人物圖片中的面部關鍵點。
  3. 然後,模型會利用這些信息生成相應的面部動畫。
  4. 最後,將生成的面部動畫與原來的圖片合成,得到最終的說話視頻。

例如這樣的圖片:

EchoMimic 輸入的人物圖片範例

加上這樣的音檔(echomimic_en.wav):

可以合成這樣的影片(示範影片 mp4)。

安裝 EchoMimic 前需要準備什麼環境?

事前作業有兩件事:先安裝 CUDA 和 CUDNN(NVIDIA CUDA Toolkit),接著安裝可支援 GPU 的 PyTorch。

要注意的是,PyTorch 所支持的 CUDA 版本有可能無法支持最新的——可以先到官網看目前最新支持到哪個版本的 CUDA。以下圖為例,我們所安裝的 CUDA 版本就不可以高於 CUDA 12.1:

PyTorch 官網顯示支援的 CUDA 版本

如何下載專案並建立 Conda 環境?

接著下載 EchoMimic 專案,並創建新的 Conda 環境、安裝所需函式庫:

```bash

git clone https://github.com/BadToBest/EchoMimic

cd EchoMimic

conda create -n echomimic python=3.8

conda activate echomimic

pip install -r requirements.txt

```

為什麼還需要安裝 FFmpeg?

EchoMimic 在處理音檔與輸出影片時會用到 FFmpeg。到 FFmpeg 官方建置頁下載(範例下載網址:ffmpeg-git-full.7z),然後將 ffmpeg 的 exe 路徑加入環境變數的 `path` 當中。如果能夠在 CMD 裡輸入 `ffmpeg` 看到版本資訊的回覆,代表安裝成功。

預訓練權重要怎麼下載?

接著下載預訓練權重。權重檔放在 Hugging Face 上,需要先用 `git lfs` 才能完整拉下來:

EchoMimic 的預訓練權重下載頁面

```bash

git lfs install

git clone https://huggingface.co/BadToBest/EchoMimic pretrained_weights

```

怎麼執行推論、產出影片?

下載完權重後,修改 `configs/prompts` 裡面的 yaml 檔案(指定要使用的人物圖片與音檔),接著執行:

```bash

python -u infer_audio2vid.py

python -u infer_audio2vid_pose.py

```

就可以看見執行的狀態,最終產生的檔案會位於 `output` 資料夾下。

延伸閱讀

常見問題

QEchoMimic 可以用在哪些場景?

最典型的是數位人(digital human)應用:虛擬主播、課程口播、行銷影片等。只要有一張清晰的正向人物照片和一段語音,就能生成對嘴說話的影片,不需要真人重新錄製。

Q執行 EchoMimic 一定要有 NVIDIA GPU 嗎?

官方流程是以 CUDA + GPU 版 PyTorch 為前提,沒有 NVIDIA 顯卡的話推論會非常慢甚至無法執行。安裝 PyTorch 前務必先確認官方支援的 CUDA 版本上限,避免版本不相容。

Q為什麼執行時會出現 ffmpeg 相關錯誤?

通常是 FFmpeg 沒有加入環境變數 `path`,導致 Python 找不到執行檔。把 ffmpeg.exe 所在資料夾加入 PATH,重新開啟 CMD 後輸入 `ffmpeg` 確認有版本輸出即可。

Q產出的影片存放在哪裡?

推論完成後,生成的影片會放在專案的 `output` 資料夾下。要更換測試素材時,修改 `configs/prompts` 內的 yaml 設定檔即可。

參考資料

最後更新

2026-08-28(原文發布於 2024-07-24,本文保留原始筆記內容並補上 GEO 結構。)

關於作者 {#author}

Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。

首次發布:2024-07-24