【實作案例】以OpenVINO實現VLM、MLLM導入產業應用
本文從技術原理出發,結合理論與實測,展示了如何以Phi-3 Vision為核心模型,配合OpenVINO部署最佳化與YOLOv8偵測模組,建構可實際落地的多模態語言模型應用架構。
【AI知多少】單模態到多模態:LLM、VLM、Video-LM
從單模態的LLM出發,目前的AI正如火如荼朝向多模態模型發展,特別是處理語言 + 平面視覺或連續視覺的VLM及Video-LM模型,讓AI看圖說故事或說故事生影片的情境成真了。
本文從技術原理出發,結合理論與實測,展示了如何以Phi-3 Vision為核心模型,配合OpenVINO部署最佳化與YOLOv8偵測模組,建構可實際落地的多模態語言模型應用架構。
從單模態的LLM出發,目前的AI正如火如荼朝向多模態模型發展,特別是處理語言 + 平面視覺或連續視覺的VLM及Video-LM模型,讓AI看圖說故事或說故事生影片的情境成真了。