
先說答案
多模態(Multimodal)是指 AI 能接收或產生不只一種形式的資訊,例如文字、圖片、聲音與影片。PDF、簡報等文件不是另一種模態,而是同時裝有文字與圖片的載體。房仲可以用多模態 AI 整理物件資料、辨識文宣與記錄帶看重點;但它不能代替屋況檢測、產權文件核對或其他專業判斷。
用房仲聽得懂的方式說
從文字助理,變成能看、能聽的助理
早期常見的聊天型 AI,很像只能用文字筆談的助理。屋況再複雜,你都要先整理成文字,它才能接著處理。多模態 AI 則像眼睛、耳朵都打開的助理:你可以傳照片、上傳文件或用語音說明,它再根據收到的資訊回答。這只是方便理解的比喻,AI 並沒有人的感官,也不會因為能描述一張照片,就真的知道現場發生了什麼。
「模態」就是資訊形式
「模態」可以先理解成資訊形式或溝通管道:文字是一種、圖片是一種、聲音與影片也是。能接收或產生兩種以上資訊形式的 AI,就可以稱為多模態 AI。以前很多資料要先人工整理成文字,現在可以直接加入照片、文件或語音,少了一道轉換;能使用哪些形式、一次能處理多少內容,仍要看產品、模型、裝置與帳號方案。
多模態 AI 能做什麼?不能做什麼?
四種常見輸入與限制
| 輸入形式 | AI 可以協助的事 | 房仲要注意的限制 |
|---|---|---|
| 圖片 | 描述畫面、辨識文字、比較照片 | 可能看錯小字、數量、位置與屋況 |
| 文件 | 摘要內容、整理欄位、尋找段落 | 可能漏掉掃描頁、表格或圖片中的資訊 |
| 語音 | 轉成文字、整理重點、產生筆記 | 人名、地址、金額可能聽錯 |
| 影片 | 摘要片段、描述事件、整理流程 | 支援格式、長度與方案依平台而異 |
AI 適合整理,不適合替你下結論
多模態 AI 能辨識圖片中的物件與文字、整理文件、轉錄語音,也能在部分產品中分析影片,再根據這些內容回答問題。它不能保證看清每個小字、還原照片外的空間、診斷屋況,或確認文件記載一定正確。房仲可以用它加快整理、找出疑點,但姓名、地址、金額、坪數、產權與瑕疵等重要資訊,仍要回到原始資料或交由專業人員確認。
房仲的三個實際場景
場景一:拍照找出屋況疑點
帶看時看到牆角有可疑痕跡,可以拍照請 AI 描述畫面中看得到的顏色、範圍與表面狀況,再列出可能原因及現場還要檢查哪些位置。提示詞不要問「這是不是壁癌」,因為單張照片無法確認水分來源、牆體內部或結構狀況。AI 看屋況只能協助發現疑點;涉及漏水、防水與結構問題,仍要由驗屋、防水或相關專業人員現場確認。實際提問可以這樣寫:
可直接使用的屋況提示詞
請只描述照片中看得到的牆面痕跡,
列出可能原因,以及現場還要檢查哪些位置。
不要直接判定是不是壁癌;
無法從照片確認的地方,請明確說明。
場景二:整理文件,少打一遍資料
多模態 AI 可以從物件 DM、平面圖或文件照片中擷取文字,省下人工逐字輸入的時間;但這不代表比較省 Token。圖片與文件同樣需要模型處理,解析度越高、頁數越多,使用量通常也會增加。正式謄本、權狀與契約還可能包含姓名、地址、權利人、統一編號及債權資料,不能因為上傳很方便,就把未遮蔽的完整文件直接交給一般 AI 服務。使用去識別化範例整理謄本時,可改用以下指令:
可直接使用的文件提示詞
請逐欄整理這份文件中可以清楚辨識的內容,
列出他項權利部的記載,並保留原文。
看不清楚或無法確認的欄位標示「無法辨識」,
不得自行推測或補寫。整理後附上原文位置,
讓我可以逐項回到文件核對。
場景三:用語音整理帶看筆記
帶看結束、車輛停妥後,可以用語音說出客戶在意的採光、格局、廚房大小與預算彈性,再請 AI 整理成帶看筆記。示範時只記錄與需求有關的內容,不要連同客戶姓名、電話或其他可識別資料一起輸入。語音辨識也可能聽錯人名、地址與金額,所以整理完仍要人工核對;若使用車載語音功能,應在出發前完成設定,行車時不要操作手機。整理指令可以這樣說:
可直接使用的語音整理指令
請把以下內容整理成帶看筆記,
分成「客戶喜歡」「客戶在意」「後續追蹤」三欄。
內容中的數字與專有名詞請原樣保留,
不確定的地方標示「待確認」。
實際操作:一分鐘體驗 AI 看圖
先準備一張不含個資的文宣
先打開目前帳號中支援圖片上傳的 AI 工具,例如 ChatGPT、Claude 或 Gemini;若看不到相機或檔案按鈕,代表功能可能尚未開放、受到方案限制,或已達使用上限。第一次練習請選擇自己製作、已公開,而且不含客戶個資的物件 DM,不要直接使用謄本、權狀、契約或身分證件。上傳圖片後,可輸入以下指令:
請 AI 抄資料,也請它標出看不清楚的地方
這是一份不動產文宣。
請逐項列出圖片中可以清楚辨識的地點、坪數、
格局與價格,並保留原文。看不清楚的內容標示
「無法辨識」,不要猜測或補寫。
再從主標、價格、物件照片與聯絡方式四個區域,
說明第一眼最容易看到什麼;若無法確認字級或
位置,請直接說明。
結果只能當初稿,重要數字要回原圖核對
AI 可以嘗試辨識圖片中的文字,也能依畫面提出排版觀察;但小字、斜拍、反光、低解析度與複雜表格都會降低準確度。OpenAI 與 Anthropic 的官方文件都提醒,模型可能看錯旋轉圖片、過小文字、物件數量與空間位置。因此,文字與數字要回原圖核對,設計評論則當成第二意見,不要當成唯一標準。OpenAI 圖片輸入限制、Claude Vision 限制(此處放操作截圖)
上傳謄本與客戶資料,安全嗎?
先確認目的、權限與公司規範
不要把未遮蔽的客戶資料、謄本、權狀或契約直接上傳到一般 AI 服務。《個人資料保護法》第 19 條規定,非公務機關蒐集或處理個人資料,必須有特定目的並符合合法情形;第 20 條則要求個資利用原則上應在原本蒐集目的的必要範圍內。房仲使用 AI 處理客戶資料前,要先確認任務是否必要、公司是否允許,以及使用的平台會如何保存與處理資料。全國法規資料庫:個人資料保護法
遮蔽個資後,要另存成不能還原的新檔
最穩妥的方式是使用去識別化的範例文件;若業務上確實需要處理正式資料,先裁掉無關區域,永久移除姓名、統一編號、地址、電話、權利人及其他可識別內容,再輸出成新的扁平圖片。不要只在原始檔案上加一個可以移除的黑色圖層,也不要把完整文件上傳後,再要求 AI「忽略個資」,因為資料在上傳時就已經交給平台處理。
刪除對話,不一定代表資料立刻消失
以 ChatGPT 為例,官方說明聊天與上傳檔案會依對應對話的保存期間留存在帳號中;刪除包含檔案的對話後,相關檔案通常會在 30 天內從系統刪除,但仍有去識別化、安全或法律需求等例外。個人工作區是否允許內容用於模型改善,也和帳號方案及資料控制設定有關。處理業務資料前,不要只看「有沒有上鎖圖示」,應先看公司政策與平台最新資料條款。OpenAI 檔案上傳 FAQ
常見問題 FAQ
Q:AI 看得懂物件照片嗎?
AI 能辨識並描述照片中的物件、文字、顏色與空間關係,但「能描述」不等於「完全理解現場」。它可能看錯小字、數錯物件、誤判位置,也不知道照片外還有什麼。拿物件照片詢問時,最好標記要看的區域,要求它區分「照片中看得到的事實」「可能原因」與「無法確認的部分」,再由房仲回到現場或原始資料核對。
Q:AI 看圖的判斷可以直接相信嗎?
AI 看圖適合協助找線索,不適合直接下結論。文件辨識要核對原始欄位;屋況照片只能整理可見特徵與待查問題;涉及漏水、結構、產權或交易責任時,仍要交由合格專業人員及正式文件確認。Anthropic 官方也提醒,圖片品質差、角度旋轉、尺寸過小或需要精準定位時,模型可能產生錯誤,不應在高風險情境中缺少人工審查。Claude Vision 官方文件
Q:拍文件上傳,真的比較省 Token 嗎?
不一定。拍照上傳可以省下人工打字時間,但圖片同樣會占用模型的處理額度;解析度越高、頁數越多,使用量往往越大。如果原本就有可搜尋的 PDF 或文字檔,直接上傳通常比拍攝每一頁更容易辨識。若只需要確認某個欄位,裁切到必要區域再上傳,可以減少干擾,但仍要保留足夠上下文,避免 AI 看錯欄位關係。
Q:免費版就有多模態功能嗎?
多數主流 AI 的一般帳號已提供部分圖片、文件或語音功能,但三家的額度、裝置與開放範圍不同,不能寫成完全一樣。以 ChatGPT 為例,截至 2026 年 7 月,OpenAI 官方說明免費帳號每天最多上傳 3 個檔案,尖峰時還可能調低;免費語音則在每 24 小時滾動期間內提供有限使用量,實際上限可能變動。ChatGPT 檔案上傳 FAQ、ChatGPT Voice 說明
Gemini 與 Claude 的限制不同
Google Gemini 官方說明,目前單次提示最多可加入 10 個支援的檔案,但仍受帳號與可用性限制;不同功能也有各自的滾動額度。Claude 的官方文件則提醒,圖片過小、旋轉或壓縮過度時,可能發生錯誤判讀。功能與額度都會改動,最準確的判斷方式仍是查看自己帳號中的上傳按鈕、用量提示與官方最新說明。Gemini 檔案上傳說明、Claude Vision 文件
系列完結:你的 AI 字典拼圖
#1~#5:先懂 AI 怎麼回答、為什麼會出錯
前五篇建立的是使用 AI 的基本觀念:#1 說明生成式 AI 如何產生新內容;#2 解釋 Prompt 為什麼會影響回答;#3 提醒 AI 可能出現幻覺;#4 說明 Token 與使用額度;#5 則用「工作桌」解釋上下文與對話記憶。這幾個概念放在一起,能幫你看懂 AI 為什麼有時答得好、有時忘記事情,也知道哪些內容需要查證。
#6~#9:再懂模型、Agent、生成與多模態
後四篇談的是 AI 能力與工作方式:#6 說明模型之間為什麼會有差異;#7 介紹能拆解任務與使用工具的 AI Agent;#8 解釋 AI 圖片與影片如何生成,以及房仲使用時不能碰的廣告紅線;#9 則補上圖片、文件與語音輸入背後的多模態概念。這九個名詞不需要背定義,但能幫你分辨一套 AI 教學到底在談什麼。
下一站:讓 AI 接上工具
想繼續往工具串接走,可以閱讀〈MCP,其實沒那麼難〉。MCP(Model Context Protocol,模型上下文協定)是一套讓 AI 連接外部工具與資料的標準方式。接下來的實戰系列,則會改用「一篇解決一個房仲任務」的方式,提供操作流程、查核提醒與可以直接調整的指令範例。〔發布前補上 MCP 文章網址〕
本文資料來源
多模態功能、免費額度與資料政策可能調整,本文以 2026 年 7 月 28 日查得的官方資料為準。處理客戶與物件資料時,仍應配合公司規範、平台最新條款及相關法令。
作者:巫建穎|AI 研究所教官,專教不動產從業人員 AI 實戰應用。
延伸閱讀:
・〈MCP,其實沒那麼難〉
・〈生成式 AI 是什麼?房仲需要學嗎?〉
巫建穎
關於我
我目前在 太平洋房屋員林站前店 擔任副店長。
我為什麼開始接觸 AI?
我真正開始接觸 AI,大約是在今年四月初。
當時會接觸 AI,不是為了追流行,而是工作上真的有需要。身為房仲,我常要快速試算稅務、整理資料,或協助客戶初步判斷問題,但原有工具在外出拜訪、帶看或討論案件時,用起來並不順手。
從不懂程式,到做出自己的網站
我就這樣從完全不懂程式開始,一步一步用 AI 做出自己的稅務試算網站。
現在面對客戶時,我可以更快協助他們了解:
- 房地合一稅
- 土地增值稅
- 其他不動產稅務問題
做完這個網站後,我才真正發現,AI 可以直接成為工作上的助理。原本需要花很多時間重複處理的工作,也能重新整理成比較省事的流程。
把 AI 帶進房仲工作
後來,我開始研究:
- AI 圖片生成
- AI 影片生成
- 提示詞設計
- 內容創作
- 行銷應用
- AI 助理開發
我也開始思考,這些工具可以怎麼真正用在房仲服務、社群經營和教育訓練上。
從使用者,走向種子教官
最近,我通過了 太平洋房屋 AI 種子教官初階考核,也擔任種子教官隊長。
對我來說,通過考核只是第一步。
接下來更重要的是,把自己學到的 AI 工具和實務經驗整理好,變成同仁:
- 看得懂
- 學得會
- 能直接帶回工作上使用
我怎麼看 AI?
我從來不覺得 AI 可以取代房仲。
它比較像是一位助理,幫我們更快整理想法、完成內容,把省下來的時間留給客戶,處理他們真正關心的問題。
我一開始接觸 AI,想解決的問題其實很簡單:
有沒有辦法少做一點重複工作,把時間用在更有價值的事情上?
接下來,我會繼續把 AI 整理成房仲真正學得會、用得上的工作方法。


