監視器升級AI怎麼選?落石入侵軌道,生成式AI也看得懂!

在生活中,我們漸漸習慣由 AI 輔助完成各種工作,監視系統也不例外。


像是工廠利用 PPE 偵測,確認人員有沒有戴安全帽、穿反光背心;長照中心利用跌倒偵測,讓照護人員第一時間發現異常;大型表演藝術中心則利用人流分析,避免因人潮過多造成推擠。


這些 AI 的目的都是一樣,在事情發生前先發現異常,彌補人力有限、容易疲勞及視覺死角等問題。

看得到,卻無法理解?傳統 AI 缺少的是「情境判斷」

目前常見的 AI 影像辨識,大多是建立在大量資料訓練上。

以安全帽為例,人們透過大量不同角度、光線和顏色的安全帽影像訓練 AI,因此只要在模型學習過的範圍內,人員出現在鏡頭前,它就能快速判斷是否有依規定配戴。

傳統 AI 並不是不好,而是它的能力來自於訓練資料。它擅長辨識已經學習過的目標,像是安全帽、反光背心、人員跌倒或車輛等特定事件。只要在學習過的範圍內,通常都能提供穩定且準確的結果。

 

情境思考:

假設同樣是一位沒有穿戴安全帽和反光背心的工作人員。

  • 站在辦公室,可能只是準備下班
  • 站在工廠作業區,就代表存在安全風險。

人一眼就能理解兩者的差異,但傳統 AI 擅長的是「辨識目標」,而不是「理解場景」。它能辨識出「沒有安全帽」,但無法像人一樣判斷:「人在哪裡沒有穿戴,才真正存在安全風險。」這正是生成式 AI 開始導入智慧監控的關鍵原因。

生成式 AI 更適合處理沒有固定樣態的事件

當攝影機一樣負責「看」畫面,生成式 AI(Generative AI)則扮演「大腦」的角色,開始理解畫面裡發生了什麼事。


對於沒有固定樣態的事件,更能看出生成式 AI 的價值。像是天災、樹倒、落石、車禍或電線桿倒塌,每次發生的狀況都不同,很難利用固定模式進行訓練。


以柏聯科技的知名山區軌道異物入侵案場為例,近期受到豪雨影響,軌道旁經常出現落石、倒塌樹木及泥沙堆積。


這些異物每次出現的樣貌都不同,可能是一顆大石頭,也可能是一堆碎石;有時是倒下的樹枝,有時是土石流覆蓋路面。


這些都會影響通行,但很難事先收集所有情境來訓練傳統的 AI。​所以像這類需要理解現場情況,再判斷是否有危險的場景,就很適合導入生成式 AI。不需要再花大量的人力24小時盯守,假日也不必另外派人管控。


在知名山區案場,便採用鐵雲科技的生成式 AI(Generative AI)進行軌道異物偵測,而背後所使用的,正是近年受到關注的 LLaVA 技術。

LLaVA 是什麼?

LLaVA(Large Language and Vision Assistant)開發團隊最初希望讓大型語言模型不只理解文字,也能理解圖片,並回答與圖片相關的問題。

當時GPT-4 已展現出強大的多模態能力,也就是能同時理解文字與圖片,但模型細節並未公開。因此,研究團隊希望利用開源模型實現類似的視覺對話能力。

為了達成這個目標,LLaVA 結合了視覺模型(Vision Encoder)與大型語言模型(LLM),讓 AI 不只是辨識畫面中的物件,更能理解圖片內容,並以自然語言回答問題。

後來,這項技術逐漸延伸到智慧監控、文件解析、工廠巡檢及企業多模態 AI 助理等領域。

LLaVA 歷經多次演進,目前已發展出多個版本包括:

LLaVA 在智慧監控的3大優勢

  • 1. 開源架構,支援地端部署

    相較於商業模型GPT-4o、Gemini、Claude必須連接雲端服務,LLaVA 採用開源架構,可自行下載部署,不必將資料傳送至外部雲端。對於政府機關、軍警單位、交通監控、半導體廠等重視資料安全的場域,更適合導入地端 AI 系統。

 

  • 2. 部署門檻較低

    LLaVA 1.5 提供 7B、13B 等不同模型規模,其中 7B 模型即可提供不錯的影像理解能力,在兼顧運算效率的同時,也降低企業導入生成式 AI 的門檻。

 

  • 3. 具備事件理解能力

    LLaVA 不只看見畫面中的人物、車輛或物件,更能理解事件內容,將影像轉換成自然語言描述。搭配 YOLO 等即時偵測模型後,可應用於安全帽辨識、人員跌倒、火焰煙霧、人數統計及異常事件分析,形成完整的 AI 視覺分析系統。

VAIDIO 生成式 AI 系統架構

在 VAIDIO 的生成式 AI 架構中,YOLO的即時偵測模型主要負責辨識已經訓練過的目標,例如人員、車輛、動物、安全帽或跌倒事件。這類事件具有明確特徵,能快速完成辨識與告警。


但像落石、倒塌樹木、土石流的泥沙堆積等情況,每次出現的樣貌都不同,很難事先定義成固定類別。這時便由 LLaVA 負責理解畫面內容,將看到的情況轉換成自然語言描述,幫助判斷是否影響通行或存在風險。


最後再由 VAIDIO 整合兩種 AI 的分析結果,透過 VMS、APP 或警示設備通知管理人員查看事件。

柏聯科技 x VAIDIO 知名山區成功案例

鐵雲科技 VAIDIO 採用成熟穩定的 LLaVA 1.5 架構,並使用 70 億參數(7B)模型,讓 AI 影像辨識從純「辨識」進入「理解」階段,能夠描述畫面內容,並進一步理解事件背後的情境,找出可疑物件。