
先講結論
想讓 AI 生成人物更像本人,與其不斷更換工具、把提示詞寫得越來越長,不如先檢查三件事:
-
原始照片是否使用美肌、濾鏡或明顯修圖?
-
提供的人物角度,是否足以支撐妳想生成的動作?
-
是否一次要求 AI 同時修改服裝、場景、姿勢和畫風?
這三點不是所有 AI 工具都適用的固定公式,也不是一項大型統計調查的結論,而是我在 2026 年 7 月帶領房仲學長姐進行 AI 生圖實作時,反覆遇到的三種狀況。
相關研究與工具官方文件也提供了一些可以互相對照的依據:
-
2023 年發表於 CVPR 的 DreamBooth 研究,使用少量人物或物件照片學習特定主體,再將其生成於不同場景、姿勢及視角中。
-
OpenAI 官方文件指出,較高的輸入保真度,有助於在圖片編輯時保留臉部及其他輸入細節。
-
Midjourney 官方則提供 Omni Reference,目的之一就是在不同圖片中維持人物或物件的一致性。
這些資料共同說明一件事:人物一致性不只受到文字提示影響,也和參考圖片、生成方式及工具功能有關。
「明明上傳的是我的照片,為什麼做出來還是完全不像我?」
這是我在 2026 年 7 月房仲 AI 實作課程中,經常收到的問題。
很多學長姐原本以為,只要上傳一張自己的照片,再告訴 AI「五官不能改、一定要像本人」,就能直接生成不同服裝、動作和場景。
實際操作後卻發現:
-
正面看起來有點像,換成側面就像另一個人。
-
原本的圖片還算接近,一換服裝就開始變臉。
-
提示詞越寫越長,人物反而越不穩定。
-
同一組照片每次生成,五官和年齡感都不太一樣。
這並不一定代表工具不好,也不能只歸咎於提示詞寫錯。
AI 並不認識現實生活中的妳。它只能根據這次收到的照片與文字,判斷人物可能具有哪些特徵,再生成一張新的圖片。
所以問題不只是:
「我有沒有上傳照片?」
更重要的是:
「我上傳的照片,是否都在告訴 AI 同一件事?」
原因一:美肌照片可能改變的不只是皮膚
很多人把美肌理解成磨皮、提亮膚色或修掉痘痘。
但部分美肌與人像修飾功能,還可能調整:
-
臉部寬度
-
下巴長度
-
眼睛大小
-
鼻子比例
-
額頭與臉型
-
五官之間的距離
影像研究中確實存在透過臉部特徵點與幾何變形,改變臉型或局部五官的方法。例如,AutoToon 研究便以臉部幾何變形呈現人物特徵;另一項臉部影像變形研究,也示範利用臉部特徵點放大或縮小局部區域。
這些研究不等於直接證明「所有美肌照片都會讓 AI 生成失敗」,但可以幫助我們理解:修圖不一定只改顏色和皮膚,也可能改變臉部幾何結構。
如果正面照使用了明顯瘦臉,45 度照片的下巴又被拉尖,側面照卻沒有相同程度的修飾,這幾張照片呈現出的五官比例就可能不完全一致。
對本人和熟人來說,每張照片看起來都是同一個人;但 AI 收到的,可能是幾組不完全相同的臉部資訊。
我會怎麼建議學員準備照片?
如果要建立長期使用的 AI 人物參考圖,建議優先選擇:
-
沒有開啟美肌瘦臉、大眼及縮下巴的原始照片。
-
臉部光線清楚、不過曝、不被陰影遮住。
-
拍攝時間接近,避免混合不同年齡階段的照片。
-
妝容、髮型與髮色差異不要太大。
-
不要同時混用原始照片和重度美肌照片。
-
臉部不要被口罩、墨鏡、頭髮或手遮住。
如果妳希望 AI 生成的是「平常社群上習慣呈現的自己」,可以使用輕微修飾、但五官比例一致的照片;如果目標是盡量接近真實長相,則建議另外拍攝一組未使用美肌和濾鏡的照片。
可複製的照片檢查提示詞
請先分析我上傳的人物照片,不要生成圖片。請比較每張照片的臉型、眼睛大小、鼻型、下巴長度、五官比例、髮型與身材比例,判斷照片之間是否有明顯差異。請告訴我哪些照片適合共同作為 AI 人物參考,哪些照片可能因美肌、濾鏡、拍攝角度或修圖程度不同而不建議混用。無法確定的地方請直接說明,不要自行推測。
原因二:只提供正面照,AI 看不到其他角度的妳
一張清楚的正面照,可以提供正面五官、髮型與部分臉型資訊。
但是,它通常無法完整呈現:
-
側臉的鼻子與下巴線條
-
左右45度的臉部輪廓
-
後腦勺與背面髮型
-
身高及身材比例
-
轉身、低頭、抬頭時的五官變化
-
手腳與全身姿態
當參考照片中沒有這些資訊,卻要求 AI 生成側身、奔跑、低頭看手機或抬頭等動作時,工具仍可能產生圖片,但沒有出現在參考照片裡的部分,就必須由模型推測。
2023 年 CVPR 發表的 DreamBooth 研究,使用少量、通常約 3至5張特定主體照片,讓模型學習該主體,進而生成不同場景、姿勢、視角和光線下的影像。這項研究採用的是模型微調技術,和一般人直接在 ChatGPT 或 Midjourney 上傳照片的操作方式並不完全相同,因此不能直接解讀成「上傳3至5張照片就一定會像」。
但它至少說明:要在不同情境中維持特定人物特徵,除了文字描述,也需要讓系統取得人物的視覺資訊。
參考:DreamBooth:CVPR 2023 研究論文
我在實作課程中的做法
如果學員希望後續生成不同動作,我通常會建議先準備:
-
清楚正面照
-
左右45度照片
-
左右側面照
-
正面全身照
-
側面全身照
-
背面照
這不是每個工具官方規定的固定張數,而是我在教學實作中,用來減少 AI 猜測範圍的準備方式。
照片也不是越多越好。
如果一次上傳很多張照片,卻混合不同年齡、不同妝容、不同濾鏡和不同髮型,可能反而讓人物特徵變得更混亂。
比起追求照片數量,更重要的是:
清楚、一致,而且角度能支撐妳想生成的畫面。
可複製的拍攝規劃提示詞
我想建立一組專門提供給 AI 生成人物使用的參考照片。請幫我規劃拍攝清單,包含正面、側面、45度、背面及全身角度,並說明光線、表情、服裝、髮型、背景與拍攝距離的注意事項。目標是讓後續生成不同動作與場景時,人物仍盡量維持相同的臉型、五官及身材比例。此階段請勿生成圖片。
原因三:一次修改太多條件,出了問題也不知道是哪一步造成的
第一次接觸 AI 生圖時,我們很容易把所有期待都寫進同一個提示詞。
例如:
請把人物換成黑色西裝,站在豪宅客廳,雙手抱胸,看向窗外,畫面改成韓系電影感,人物一定要像本人。
看起來只是一段指令,但其中同時包含:
-
人物長相
-
服裝
-
姿勢
-
手部動作
-
表情與視線
-
室內場景
-
光線
-
構圖
-
畫面風格
我建議「一次只改一個主要條件」,並不是宣稱所有模型都只能接受短提示詞,而是為了控制變因。
當妳一次只換服裝,如果人物突然不像,就能知道問題可能發生在這一步;如果一次改了八、九個條件,最後人物跑掉,就很難判斷到底是哪項修改造成的。
OpenAI 在 2025年7月17日發布的高輸入保真度範例中,便使用「只改杯子的顏色」「移除杯子」等局部任務,示範在保留其他畫面內容的情況下進行控制式修改。官方也指出,高輸入保真度有助於在編輯時保留臉部,使人物在不同背景或風格下仍較容易辨識。
參考:OpenAI:Generate images with high input fidelity
OpenAI 的圖片提示指南也建議,在人物置入新場景時,明確說出哪些人物特徵不能改變;若工具支援,較高的輸入保真度有助於在大型場景修改中維持相似度。
參考:OpenAI:GPT Image Prompting Guide
Midjourney 官方文件則提醒,即使只改動提示詞、模型版本或部分設定,生成結果仍可能出現預期外的變化。Midjourney 因此建議以 Style Reference、Omni Reference 等功能處理一致性,而不是只依賴固定種子。
參考:Midjourney:Seeds 官方說明
我實際使用的四階段生成流程
第一步:先確認人物長相
第一張圖先不要急著換服裝、背景、姿勢與畫風,只確認人物的臉型、五官、髮型和身材比例。
提示詞:
請根據我上傳的人物照片,生成一張人物參考圖。完整保留原人物的臉型、五官比例、眉型、眼睛、鼻型、嘴型、髮型、髮色、膚色、年齡感、身材比例與個人辨識特徵,讓熟悉人物的人能辨認是同一個人。此階段不要更換服裝、姿勢、背景與畫風。
第二步:只修改服裝
確認第一張人物接近本人後,再以這張圖為基礎更換服裝。
提示詞(括號內根據個人需求修改):
請以上一張確認的人物圖片為基礎,只將服裝改成(西裝外套與白色襯衫)。人物的臉型、五官、髮型、膚色、年齡感、身材比例、姿勢、表情、背景、光線與構圖全部保持不變。
第三步:只修改場景
服裝確認後,再處理背景。
提示詞(括號內根據個人需求修改):
請保持目前人物的臉型、五官、髮型、服裝、姿勢、表情及身材比例不變,只將背景更換成(明亮、有質感的住宅客廳)。畫面自然、溫暖,具有生活感,不要改變人物長相。
第四步:最後修改動作
提示詞(括號內根據個人需求修改):
請保持目前人物長相、髮型、服裝、背景、光線與構圖不變,只將人物動作改成(自然拿著資料夾站立。)手指及手部比例要自然,不可改變人物五官、臉型與身材比例。
每完成一步,都先確認人物是否仍然接近本人。
如果人物在某一步開始跑掉,不要繼續用錯誤版本往下修改,而是回到上一張比較接近本人的圖片,再重新調整。
人物不像本人:原因與處理方式
| 實際狀況 | 可能原因 | 建議處理方式 |
|---|---|---|
| 有一點像,但臉型與五官比例不同 | 照片可能經過美肌或臉型修飾 | 改用未過度修飾的原始照片 |
| 正面接近本人,側面卻像另一個人 | 參考照片缺少側面或45度資訊 | 補充一致、清楚的不同角度照片 |
| 一換服裝或場景就開始變臉 | 同時修改太多主要條件 | 分成服裝、場景、動作逐步處理 |
| 每張圖片的年齡感都不同 | 混用不同時期的人物照片 | 選擇拍攝時間與外貌狀態接近的照片 |
| 上傳很多張仍然不穩定 | 照片的妝容、濾鏡或髮型差異過大 | 減少照片數量,優先保留一致素材 |
| 一直強調「五官不能改」仍然不像 | 文字無法補足照片中不存在的視覺資訊 | 補充參考照片,或使用工具的人物參考功能 |
不同 AI 工具都適用這套方法嗎?
不能保證完全相同。
不同工具對圖片參考、人物一致性、輸入張數及圖片編輯的處理方式並不一樣。
以具名工具來說:
-
OpenAI GPT Image:官方文件提供圖片編輯與輸入保真度設定。較高的輸入保真度,主要用於加強輸入圖片細節、臉部及視覺識別特徵的保存。
-
Midjourney V7:官方提供 Omni Reference,可將參考圖片中的人物或物件帶入新的生成畫面。
-
DreamBooth:屬於針對特定主體進行模型微調的研究方法,和一般聊天式生圖工具的操作流程不同。
Midjourney 官方明確表示,Omni Reference 可以使用參考圖片中的人物或物件,並將其帶入新的創作中。
參考:Midjourney:Omni Reference
OpenAI 官方則說明,input_fidelity 用來控制圖片編輯或參考圖片工作流程中,模型保留輸入圖片細節的程度。
參考:OpenAI:Image Generation Guide
因此,更精確的說法不是「所有工具都必須遵守同一套方法」,而是:
不同工具的功能與操作方式不同,但使用一致的參考照片、降低素材衝突,並分階段檢查生成結果,是我在房仲 AI 生圖實作中較容易找出問題的方法。
常見問題 FAQ
只有一張正面照,可以生成其他動作嗎?
可以生成,但不代表一定能準確還原本人。
如果要求的是正面、簡單站姿,可能比較容易維持;如果要求側身、低頭、奔跑或大幅度轉身,照片中沒有呈現的部分就需要由 AI 推測。
照片是不是越多越好?
不一定。
清楚、一致、拍攝時間接近的照片,通常比混合不同濾鏡、年齡、妝容及髮型的大量照片更適合作為人物參考。
目前沒有一個能適用所有 AI 工具的固定張數,仍要依工具的圖片輸入方式與官方說明操作。
只有美肌照片,還能使用嗎?
可以先挑選修飾程度較低、五官比例較一致的照片嘗試。
如果要長期製作房仲形象照、社群圖卡或個人 IP,建議另外拍攝一組沒有瘦臉、大眼及重度濾鏡的照片,專門作為 AI 人物參考素材。
提示詞一直寫「不可改變五官」,為什麼還是會變?
因為文字可以表達妳希望保留什麼,卻無法補回原始照片中沒有呈現的視角和細節。
另外,生成式 AI 產出的仍是新圖片,不等於傳統修圖軟體逐像素鎖定原始人物。即使使用人物參考或高輸入保真度,也不應理解成百分之百不會變動。
一次只改一個條件,真的一定比較像嗎?
不能保證。
這個方法最大的價值,是幫助使用者控制變因、找出人物從哪一步開始跑掉,而不是保證每次生成都成功。
結語:先讓 AI 看清楚妳,再要求它改變妳
AI 生成人物不像本人時,不一定要立刻更換平台,也不一定需要把提示詞寫得更複雜。
可以先回頭檢查:
-
參考照片有沒有明顯美肌或五官變形?
-
不同照片中的人物狀態是否一致?
-
照片角度能不能支撐想生成的動作?
-
這次是不是同時改了太多條件?
-
使用的工具是否具有人物參考或輸入保真度功能?
AI 不認識現實生活中的妳,只能根據妳提供的素材和指令,逐步建立對這個人物的判斷。
先準備一致、清楚、不過度修飾的人物照片,再按照「確認長相、修改服裝、更換場景、調整動作」的順序進行。
看起來多了幾個步驟,卻更容易知道問題發生在哪裡。
有時候慢一點,反而更快。
當人物版本逐漸穩定,未來不論要製作房仲形象照、社群圖卡、短影音或個人 IP,都會更容易延續同一個人的辨識度。
本文資料來源
-
蔡雅涵,2026年7月房仲 AI 生圖實作課程之教學觀察。
-
Ruiz, N. et al., DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation, CVPR 2023。
-
OpenAI, Image Generation Guide。
-
OpenAI, Generate Images with High Input Fidelity, 2025年7月17日。
-
OpenAI, GPT Image Prompting Guide。
-
Midjourney, Omni Reference、Seeds 官方說明。
-
Gong, J. et al., AutoToon: Automatic Geometric Warping for Face Cartoon Generation, WACV 2020。









