手册运营

基于多模态大模型

手册 · 覆盖 运营,约 10 分钟。

手册·约 10 分钟·共 3 页·更新 2026-09·纠错 / 投稿

基于多模态大模型(给现实世界加一本说明书)

前言

随着ChatGPT*()*的蓬勃发展,大型模型正深刻地影响着各个行业,技术的飞速发展让人感觉仿佛“度日如年”(每天涌现的新技术数量甚至超过过去一年)。在这个快速发展的潮流中,多模态技术作为行业的前沿更是突飞猛进,呈现出一统计算机视觉(CV)和自然语言处理(NLP)的势头。

本文介绍了一款能够迅速解释现实世界的应用,它基于多模态大型模型,为现实世界提供了一本实时说明书。将手机置于车载摄像机位置,该应用能够实时分析当前地区今年新春的最新流行趋势。不仅展示了多模态技术的强大之处,还为我们提供了对真实世界的深入解释。

《基于多模态大模型》 前言 配图 1

这是快速在手机上利用多模态技术的方式之一,「近距离地感受一下大模型对传统APP开发的降维打击」。

在这种架构中*,后端采用 llama.cpp 挂载 LLaVA 模型,为应用提供推理服务。同时,部署了一个 Flask 应用用于数据前处理和后处理,提供 Stream 流服务。前端页面采用 HTML5,用于*采集画面和用户输入,整体设计以简单高效为主打。

建立 llama.cpp 服务器

《基于多模态大模型》 建立 llama.cpp 服务器 配图 1

《基于多模态大模型》 建立 llama.cpp 服务器 配图 2

LLaVA 模型

下载模型 ggml_llava-v1.5-13b,这里选择是13b 4bit 的模型。

《基于多模态大模型》 LLaVA 模型 配图 1

BakLLaVA 推理速度更快,但对中文的支持较差,7b的模型在语义理解方面普遍存在不足,特别是在需要规范数据格式进行交互的场合。对于function call和action操作,极度依赖模型的AGI能力。希望开源社区在不断努力,早日赶上GPT-4V的水平。

相关资料

更多