教學-初階#多模態 AI · #房仲 AI 實戰 · #AI 看圖與文件辨識

多模態是什麼?AI 真的看得懂物件照片嗎?

文字、照片、語音都能處理,原來這就叫多模態

巫建穎
巫建穎房仲 AI 實戰教官
2026/07/29發佈2026/08/23最後更新17 分鐘閱讀15觀看
收藏即追蹤更新分享至
多模態是什麼?AI 真的看得懂物件照片嗎?

先說答案

多模態(Multimodal)是指 AI 能接收或產生不只一種形式的資訊,例如文字、圖片、聲音與影片。PDF、簡報等文件不是另一種模態,而是同時裝有文字與圖片的載體。房仲可以用多模態 AI 整理物件資料、辨識文宣與記錄帶看重點;但它不能代替屋況檢測、產權文件核對或其他專業判斷。

用房仲聽得懂的方式說

從文字助理,變成能看、能聽的助理

早期常見的聊天型 AI,很像只能用文字筆談的助理。屋況再複雜,你都要先整理成文字,它才能接著處理。多模態 AI 則像眼睛、耳朵都打開的助理:你可以傳照片、上傳文件或用語音說明,它再根據收到的資訊回答。這只是方便理解的比喻,AI 並沒有人的感官,也不會因為能描述一張照片,就真的知道現場發生了什麼。

「模態」就是資訊形式

「模態」可以先理解成資訊形式或溝通管道:文字是一種、圖片是一種、聲音與影片也是。能接收或產生兩種以上資訊形式的 AI,就可以稱為多模態 AI。以前很多資料要先人工整理成文字,現在可以直接加入照片、文件或語音,少了一道轉換;能使用哪些形式、一次能處理多少內容,仍要看產品、模型、裝置與帳號方案。

多模態 AI 能做什麼?不能做什麼?

四種常見輸入與限制

輸入形式AI 可以協助的事房仲要注意的限制
圖片描述畫面、辨識文字、比較照片可能看錯小字、數量、位置與屋況
文件摘要內容、整理欄位、尋找段落可能漏掉掃描頁、表格或圖片中的資訊
語音轉成文字、整理重點、產生筆記人名、地址、金額可能聽錯
影片摘要片段、描述事件、整理流程支援格式、長度與方案依平台而異

AI 適合整理,不適合替你下結論

多模態 AI 能辨識圖片中的物件與文字、整理文件、轉錄語音,也能在部分產品中分析影片,再根據這些內容回答問題。它不能保證看清每個小字、還原照片外的空間、診斷屋況,或確認文件記載一定正確。房仲可以用它加快整理、找出疑點,但姓名、地址、金額、坪數、產權與瑕疵等重要資訊,仍要回到原始資料或交由專業人員確認。

房仲的三個實際場景

場景一:拍照找出屋況疑點

帶看時看到牆角有可疑痕跡,可以拍照請 AI 描述畫面中看得到的顏色、範圍與表面狀況,再列出可能原因及現場還要檢查哪些位置。提示詞不要問「這是不是壁癌」,因為單張照片無法確認水分來源、牆體內部或結構狀況。AI 看屋況只能協助發現疑點;涉及漏水、防水與結構問題,仍要由驗屋、防水或相關專業人員現場確認。實際提問可以這樣寫:

可直接使用的屋況提示詞

code
請只描述照片中看得到的牆面痕跡,
列出可能原因,以及現場還要檢查哪些位置。
不要直接判定是不是壁癌;
無法從照片確認的地方,請明確說明。

場景二:整理文件,少打一遍資料

多模態 AI 可以從物件 DM、平面圖或文件照片中擷取文字,省下人工逐字輸入的時間;但這不代表比較省 Token。圖片與文件同樣需要模型處理,解析度越高、頁數越多,使用量通常也會增加。正式謄本、權狀與契約還可能包含姓名、地址、權利人、統一編號及債權資料,不能因為上傳很方便,就把未遮蔽的完整文件直接交給一般 AI 服務。使用去識別化範例整理謄本時,可改用以下指令:

可直接使用的文件提示詞

code
請逐欄整理這份文件中可以清楚辨識的內容,
列出他項權利部的記載,並保留原文。
看不清楚或無法確認的欄位標示「無法辨識」,
不得自行推測或補寫。整理後附上原文位置,
讓我可以逐項回到文件核對。

場景三:用語音整理帶看筆記

帶看結束、車輛停妥後,可以用語音說出客戶在意的採光、格局、廚房大小與預算彈性,再請 AI 整理成帶看筆記。示範時只記錄與需求有關的內容,不要連同客戶姓名、電話或其他可識別資料一起輸入。語音辨識也可能聽錯人名、地址與金額,所以整理完仍要人工核對;若使用車載語音功能,應在出發前完成設定,行車時不要操作手機。整理指令可以這樣說:

可直接使用的語音整理指令

code
請把以下內容整理成帶看筆記,
分成「客戶喜歡」「客戶在意」「後續追蹤」三欄。
內容中的數字與專有名詞請原樣保留,
不確定的地方標示「待確認」。

實際操作:一分鐘體驗 AI 看圖

先準備一張不含個資的文宣

先打開目前帳號中支援圖片上傳的 AI 工具,例如 ChatGPT、Claude 或 Gemini;若看不到相機或檔案按鈕,代表功能可能尚未開放、受到方案限制,或已達使用上限。第一次練習請選擇自己製作、已公開,而且不含客戶個資的物件 DM,不要直接使用謄本、權狀、契約或身分證件。上傳圖片後,可輸入以下指令:

請 AI 抄資料,也請它標出看不清楚的地方

code
這是一份不動產文宣。

請逐項列出圖片中可以清楚辨識的地點、坪數、
格局與價格,並保留原文。看不清楚的內容標示
「無法辨識」,不要猜測或補寫。

再從主標、價格、物件照片與聯絡方式四個區域,
說明第一眼最容易看到什麼;若無法確認字級或
位置,請直接說明。

結果只能當初稿,重要數字要回原圖核對

AI 可以嘗試辨識圖片中的文字,也能依畫面提出排版觀察;但小字、斜拍、反光、低解析度與複雜表格都會降低準確度。OpenAI 與 Anthropic 的官方文件都提醒,模型可能看錯旋轉圖片、過小文字、物件數量與空間位置。因此,文字與數字要回原圖核對,設計評論則當成第二意見,不要當成唯一標準。OpenAI 圖片輸入限制Claude Vision 限制(此處放操作截圖)

上傳謄本與客戶資料,安全嗎?

先確認目的、權限與公司規範

不要把未遮蔽的客戶資料、謄本、權狀或契約直接上傳到一般 AI 服務。《個人資料保護法》第 19 條規定,非公務機關蒐集或處理個人資料,必須有特定目的並符合合法情形;第 20 條則要求個資利用原則上應在原本蒐集目的的必要範圍內。房仲使用 AI 處理客戶資料前,要先確認任務是否必要、公司是否允許,以及使用的平台會如何保存與處理資料。全國法規資料庫:個人資料保護法

遮蔽個資後,要另存成不能還原的新檔

最穩妥的方式是使用去識別化的範例文件;若業務上確實需要處理正式資料,先裁掉無關區域,永久移除姓名、統一編號、地址、電話、權利人及其他可識別內容,再輸出成新的扁平圖片。不要只在原始檔案上加一個可以移除的黑色圖層,也不要把完整文件上傳後,再要求 AI「忽略個資」,因為資料在上傳時就已經交給平台處理。

刪除對話,不一定代表資料立刻消失

以 ChatGPT 為例,官方說明聊天與上傳檔案會依對應對話的保存期間留存在帳號中;刪除包含檔案的對話後,相關檔案通常會在 30 天內從系統刪除,但仍有去識別化、安全或法律需求等例外。個人工作區是否允許內容用於模型改善,也和帳號方案及資料控制設定有關。處理業務資料前,不要只看「有沒有上鎖圖示」,應先看公司政策與平台最新資料條款。OpenAI 檔案上傳 FAQ

常見問題 FAQ

Q:AI 看得懂物件照片嗎?

AI 能辨識並描述照片中的物件、文字、顏色與空間關係,但「能描述」不等於「完全理解現場」。它可能看錯小字、數錯物件、誤判位置,也不知道照片外還有什麼。拿物件照片詢問時,最好標記要看的區域,要求它區分「照片中看得到的事實」「可能原因」與「無法確認的部分」,再由房仲回到現場或原始資料核對。

Q:AI 看圖的判斷可以直接相信嗎?

AI 看圖適合協助找線索,不適合直接下結論。文件辨識要核對原始欄位;屋況照片只能整理可見特徵與待查問題;涉及漏水、結構、產權或交易責任時,仍要交由合格專業人員及正式文件確認。Anthropic 官方也提醒,圖片品質差、角度旋轉、尺寸過小或需要精準定位時,模型可能產生錯誤,不應在高風險情境中缺少人工審查。Claude Vision 官方文件

Q:拍文件上傳,真的比較省 Token 嗎?

不一定。拍照上傳可以省下人工打字時間,但圖片同樣會占用模型的處理額度;解析度越高、頁數越多,使用量往往越大。如果原本就有可搜尋的 PDF 或文字檔,直接上傳通常比拍攝每一頁更容易辨識。若只需要確認某個欄位,裁切到必要區域再上傳,可以減少干擾,但仍要保留足夠上下文,避免 AI 看錯欄位關係。

Q:免費版就有多模態功能嗎?

多數主流 AI 的一般帳號已提供部分圖片、文件或語音功能,但三家的額度、裝置與開放範圍不同,不能寫成完全一樣。以 ChatGPT 為例,截至 2026 年 7 月,OpenAI 官方說明免費帳號每天最多上傳 3 個檔案,尖峰時還可能調低;免費語音則在每 24 小時滾動期間內提供有限使用量,實際上限可能變動。ChatGPT 檔案上傳 FAQChatGPT Voice 說明

Gemini 與 Claude 的限制不同

Google Gemini 官方說明,目前單次提示最多可加入 10 個支援的檔案,但仍受帳號與可用性限制;不同功能也有各自的滾動額度。Claude 的官方文件則提醒,圖片過小、旋轉或壓縮過度時,可能發生錯誤判讀。功能與額度都會改動,最準確的判斷方式仍是查看自己帳號中的上傳按鈕、用量提示與官方最新說明。Gemini 檔案上傳說明Claude Vision 文件

系列完結:你的 AI 字典拼圖

#1~#5:先懂 AI 怎麼回答、為什麼會出錯

前五篇建立的是使用 AI 的基本觀念:#1 說明生成式 AI 如何產生新內容;#2 解釋 Prompt 為什麼會影響回答;#3 提醒 AI 可能出現幻覺;#4 說明 Token 與使用額度;#5 則用「工作桌」解釋上下文與對話記憶。這幾個概念放在一起,能幫你看懂 AI 為什麼有時答得好、有時忘記事情,也知道哪些內容需要查證。

#6~#9:再懂模型、Agent、生成與多模態

後四篇談的是 AI 能力與工作方式:#6 說明模型之間為什麼會有差異;#7 介紹能拆解任務與使用工具的 AI Agent;#8 解釋 AI 圖片與影片如何生成,以及房仲使用時不能碰的廣告紅線;#9 則補上圖片、文件與語音輸入背後的多模態概念。這九個名詞不需要背定義,但能幫你分辨一套 AI 教學到底在談什麼。

下一站:讓 AI 接上工具

想繼續往工具串接走,可以閱讀〈MCP,其實沒那麼難〉。MCP(Model Context Protocol,模型上下文協定)是一套讓 AI 連接外部工具與資料的標準方式。接下來的實戰系列,則會改用「一篇解決一個房仲任務」的方式,提供操作流程、查核提醒與可以直接調整的指令範例。〔發布前補上 MCP 文章網址〕


本文資料來源

多模態功能、免費額度與資料政策可能調整,本文以 2026 年 7 月 28 日查得的官方資料為準。處理客戶與物件資料時,仍應配合公司規範、平台最新條款及相關法令。

作者:巫建穎|AI 研究所教官,專教不動產從業人員 AI 實戰應用。

延伸閱讀:
・〈MCP,其實沒那麼難
・〈生成式 AI 是什麼?房仲需要學嗎?

巫建穎
ABOUT THE AUTHOR · 關於作者

巫建穎

關於我

我目前在 太平洋房屋員林站前店 擔任副店長。

我為什麼開始接觸 AI?

我真正開始接觸 AI,大約是在今年四月初。

當時會接觸 AI,不是為了追流行,而是工作上真的有需要。身為房仲,我常要快速試算稅務、整理資料,或協助客戶初步判斷問題,但原有工具在外出拜訪、帶看或討論案件時,用起來並不順手。

從不懂程式,到做出自己的網站

我就這樣從完全不懂程式開始,一步一步用 AI 做出自己的稅務試算網站。

現在面對客戶時,我可以更快協助他們了解:

  • 房地合一稅
  • 土地增值稅
  • 其他不動產稅務問題

做完這個網站後,我才真正發現,AI 可以直接成為工作上的助理。原本需要花很多時間重複處理的工作,也能重新整理成比較省事的流程。

把 AI 帶進房仲工作

後來,我開始研究:

  • AI 圖片生成
  • AI 影片生成
  • 提示詞設計
  • 內容創作
  • 行銷應用
  • AI 助理開發

我也開始思考,這些工具可以怎麼真正用在房仲服務、社群經營和教育訓練上。

從使用者,走向種子教官

最近,我通過了 太平洋房屋 AI 種子教官初階考核,也擔任種子教官隊長。

對我來說,通過考核只是第一步。

接下來更重要的是,把自己學到的 AI 工具和實務經驗整理好,變成同仁:

  • 看得懂
  • 學得會
  • 能直接帶回工作上使用

我怎麼看 AI?

我從來不覺得 AI 可以取代房仲。

它比較像是一位助理,幫我們更快整理想法、完成內容,把省下來的時間留給客戶,處理他們真正關心的問題。

我一開始接觸 AI,想解決的問題其實很簡單:

有沒有辦法少做一點重複工作,把時間用在更有價值的事情上?

接下來,我會繼續把 AI 整理成房仲真正學得會、用得上的工作方法。

查看講師頁

留言

會員限定留言。請保持專業討論,教官回覆會有金色標記。

留言為 會員限定功能——登入後即可參與討論、@ 提及講師、按讚。

載入留言中…