
omiGlass 视觉理解评测样本 img_4 解析四模型图像描述对比与智能眼镜 Agent 的落地链路【免费下载链接】FriendAI that sees your screen, listens to your conversations and tells you what to do项目地址: https://gitcode.com/GitHub_Trending/fr/Friend本篇技术指南围绕 omiGlass 开源智能眼镜项目中的视觉评测语料prompts/series_1/img_4.md展开逐段剖析同一张场景图片在四个视觉大模型基础描述、llava-llama3、llava:34b-v1.6、moondream:1.8b-v2-fp16下的描述输出差异并结合 omiGlass 源码中图像 → 描述 → 问答的 Agent 调用链说明这类评测样本在模型选型、提示词调优与端侧/云侧视觉链路中的实际价值。读者读完后既能读懂img_4.md的每一行内容也能理解它背后的视觉描述流水线与评测方法论。一、样本文件定位series_1 多模型图像描述评测语料img_4.md位于仓库的omiGlass/prompts/series_1/目录。从目录结构看该系列共包含img_1至img_57共 57 组文件每组由一张 600x800 的 JPEG 原图如img_4.jpeg与一份同名 Markdown 描述文档如img_4.md成对组成。每个.md文件内统一包含四段描述段落标题来源模型####Description####基准描述通用标注####Description (llava-llama3)####Ollama 本地视觉模型 llava-llama3####Description (llava:34b-v1.6)####Ollama 本地视觉模型 llava:34b-v1.6####Description (moondream:1.8b-v2-fp16)####Ollama 本地视觉模型 moondream:1.8b-v2-fp16这一组织方式与 omiGlass/sources/modules/ollama.ts 中声明的KnownModel联合类型完全对应——该类型显式列出了llama3、llava-llama3、llava:34b-v1.6、moondream:1.8b-v2-fp16、moondream:1.8b-v2-moondream2-text-model-f16等可选模型标识。同时omiGlass/README.md 的软件安装步骤也要求执行ollama pull moondream:1.8b-v2-fp16与评测语料中出现的模型名称一致。因此可以推断series_1是 omiGlass 为对比不同视觉模型对同一场景的描述质量而积累的评测语料img_4.md正是其中一份同一张图、多模型打分的原始记录。二、img_4.md 原文内容全解析img_4.md的完整内容由四段描述构成核心场景为一位男性在室内开阔空间站立并低头查看手机周围有其他人物但处于背景位置。下面逐段继承并解读原文。2.1 基准描述Description原文要点画面中一位男性站在开阔区域低头看着自己的手机似乎正专注于设备屏幕上的内容。周围有数人但处于背景或非画面主体位置。整体氛围表明这可能是人们聚集进行各种活动的公共场所包括使用手机。该段落是人工/基准标注只陈述可直接观察的事实不含具体推断主体的性别、姿态站立、动作低头看手机、专注于屏幕、空间性质开阔区域、可能为公共场所。注意它刻意没有断言场景是室内还是室外为后续模型描述留下了对照空间。2.2 llava-llama3 描述原文要点画面捕捉了一个室内瞬间可能是火车站。一位卷发金发的年轻男性是照片主体穿着蓝色 T 恤与牛仔裤右手握着手机完全沉浸在屏幕上。拍摄视角从男性背后能看到他屏幕上的内容或行进方向。背景中其他人被虚化说明他们不是本图焦点。背景中一个显著特征是白色天花板布满外露的管道与横梁为平淡的环境增添了工业气息。整体色调偏柔和营造出平静放松的氛围。llava-llama3 提供了最丰富的细节补充了主体外貌卷曲金发、蓝色 T 恤、牛仔裤、手持方式右手、拍摄视角从背后、以及大量环境信息白色天花板、外露管道与横梁、工业风格、柔和色调。同时它也做出了一个明确推断——可能是火车站。2.3 llava:34b-v1.6 描述原文要点画面为室内场景一人手持小型设备可能是智能手机或平板低头注视屏幕似乎在打字或与界面交互。室内特征包括天花板上的天窗以及沿房间一侧铺设的工业风管道。背景中另有一人部分可见同样在看设备。自然光透过顶部窗户进入表明可能是白天。画面中没有可转写的文字。llava:34b-v1.6 的描述更强调建筑与光线细节天窗、工业管道、自然光、白天判断在设备类型上用了可能是智能手机或平板的谨慎措辞并主动报告了没有可转写的文本这一负向观察——这与图像描述任务中转写可见文字的指令是直接相关的。2.4 moondream:1.8b-v2-fp16 描述原文要点图中男性低头看手机可能在查看路线或读取时间。画面中还有其他人物一人位于画面左侧另一人站在右上角附近。整体氛围随意而社交化房间内的人们各自进行着各种活动。moondream:1.8b-v2-fp16 作为参数量最小的端侧模型输出最为简洁仅抓住主体动作低头看手机、两个背景人物的空间位置左侧、右上角并加入了可能在查看路线或读取时间的行为推测与随意、社交化的氛围判断。三、四模型描述对比同一场景不同侧重将四段描述并置可以清晰看到视觉模型在三个维度上的能力差异维度基准描述llava-llama3llava:34b-v1.6moondream:1.8b-v2-fp16主体识别男性、站立、看手机卷发金发男性、蓝 T 恤、牛仔裤一人低头注视设备男性低头看手机设备判断手机手机右手智能手机或平板谨慎手机环境细节开阔区域、公共场所白色天花板、外露管道、工业风天窗、工业管道、自然光、白天未提及建筑细节人物关系数人在背景背景人物被虚化、非焦点左侧一人、右上角一人部分可见左侧一人、右上角一人文本转写无无明确报告无可转写文本无推断成分无纯事实可能是火车站可能是火车站建筑特征暗示、在打字可能在查看路线或读取时间可以归纳出三个可复用结论四模型在主体与核心动作上高度一致男性 手持手机 室内公共空间 背景有人说明该场景对视觉模型是高共识样本适合作为评测集基线。细节密度与模型规模基本正相关llava:34b-v1.6 与 llava-llama3 输出的环境与人物信息明显多于 1.8B 的 moondream但也引入了火车站在打字等推测——这类内容超出了纯视觉事实。谨慎与推测是描述质量的关键分水岭llava:34b-v1.6 对设备类型使用可能moondream 直接给出查看路线或读取时间的意图推断而 imageDescription.ts 中的系统提示词要求模型尽可能精确地描述图像并转写可见文字describe the image as precisely as possible. Transcribe any text you see.这意味着推断成分越少、事实成分越多的描述越贴合下游 Agent 的消费需求。四、从评测样本到生产链路描述如何驱动智能眼镜问答img_4.md这类评测样本并非孤立产物它直接对应 omiGlass 视觉 Agent 的生产流水线。以 Agent.ts 为核心链路分为两个阶段4.1 addPhoto逐帧生成描述并缓存Agent.ts 中的addPhoto(photos: Uint8Array[])在AsyncLock保护下遍历每一帧图像调用imageDescription(p)生成描述并以{ photo, description }形式追加到内存照片栈中最近一次描述会同步到 UI 状态。也就是说智能眼镜每拍到一帧画面都会立即得到一段即时视觉描述评测语料中看到的描述文本正是这条路径的产物。4.2 imageDescription系统提示词与默认模型imageDescription.ts 定义了描述函数export async function imageDescription(src: Uint8Array, model: KnownModel moondream:1.8b-v2-fp16): Promisestring { return ollamaInference({ model: model, messages: [{ role: system, content: You are a very advanced model and your task is to describe the image as precisely as possible. Transcribe any text you see. }, { role: user, content: Describe the scene, images: [src], }] }); }关键点有两个一是默认模型就是 moondream:1.8b-v2-fp16即评测样本中参数量最小的那个——说明生产环境优先考虑端侧推理速度与资源占用二是系统提示词同时要求精确描述与转写文字前者约束描述质量后者服务于读取屏幕/文档内容的眼镜场景这也解释了为何 llava:34b-v1.6 会在描述中专门报告没有可转写文本。4.3 ollamaInferencebase64 图像上传与重试ollama.ts 的ollamaInference会把每条消息中的Uint8Array图像经toBase64转成 base64 字符串随后向keys.ollama配置的本地 Ollama 服务地址发起stream: false的 POST 请求并包裹在backoff重试逻辑中响应仅取response.message.content并做缩进规整trimIdent。这解释了评测样本是如何批量产出的只要把KnownModel换成不同模型名对同一张img_4.jpeg重复调用即可得到四段对比描述。4.4 llamaFind基于描述文本作答的推理层Agent.ts 的answer(question)会把内存中所有照片的描述拼接为combined文本交给llamaFind(question, combined)处理。而 imageDescription.ts 中的llamaFind通过 groq-llama3.ts 调用云端 Groq 的llama3-70b-8192其系统提示词明确要求DO NOT mention the images, scenes or descriptions in your answer, just answer the question. DO NOT try to generalize or provide possible scenarios. ONLY use the information in the description of the images to answer the question. BE concise and specific.这段提示词揭示了一个重要架构事实智能眼镜的最终回答完全建立在描述文本之上而不是直接建立在原始图像之上。因此img_4.md这类评测样本所度量的描述质量直接决定了下游问答的准确率上限——描述漏掉的细节如 llava:34b 报告的天窗光线Agent 永远无法在回答中还原。这就是该评测语料价值的根本所在。五、多模型评测的工程意义端侧 vs 云侧、速度 vs 细节结合评测样本与源码可以梳理出 omiGlass 视觉方案在模型选择上的权衡逻辑端侧优先默认模型选择 1.8B 的 moondream本地 Ollama 推理无网络延迟、无 API 成本适合眼镜这种低功耗设备持续出帧作为对照评测语料还收录了 34B 的 llava 与更重的描述用于衡量更大模型能换回多少细节。云侧兜底推理描述阶段用轻量本地模型推理/问答阶段才用 Groq 云端的 70B 模型形成轻端重云的分层架构兼顾实时性与回答质量。评测语料驱动选型series_1的 57 组样本提供了同一场景下的多模型输出对照可以在不跑真实设备的情况下评估换模型后描述质量提升多少为KnownModel中的默认值与提示词迭代提供数据依据。此外imaging.ts 提供了rotateImage(src, 90 | 180 | 270)的图像旋转工具可将摄像头采集方向异常的帧先校正再送入描述管线说明这套评测与生产链路还考虑了物理设备带来的图像方向问题。六、复现与扩展该评测方法如需在本地复现img_4.md的产出方式并构建自己的评测集可参照 omiGlass/README.md 完成环境准备安装 Ollama 并拉取视觉模型执行ollama pull moondream:1.8b-v2-fp16默认描述模型可选拉取llava-llama3、llava:34b-v1.6用于对比评测。配置密钥与环境复制.env.template为.env填入 Groq API Key、OpenAI API Key并将 Ollama 地址配置为默认的http://localhost:11434/api/chat。启动 Expo 应用在omiGlass目录执行npm install与npm start或yarn版本通过本地 localhost 链接访问 Web 版本。采集样本并生成描述对同一场景依次将 ollama.ts 中KnownModel的模型标识传入imageDescription即可得到与img_4.md格式一致的多模型描述记录遇到方向异常帧先调用rotateImage校正。纳入评测语料将原图与描述文档按prompts/series_1/的一图一 md、四段描述约定归档即可逐步沉淀自己的视觉模型回归评测集。需要说明的是本地复现的描述内容会随 Ollama 版本、模型权重与提示词改动而有所差异img_4.md记录的是该项目当时特定环境下的输出快照。七、总结img_4.md表面上是四段关于一名男性在室内低头看手机的图片描述实际上它是 omiGlass 视觉能力工程化的一个缩影它既是多模型评测语料衡量描述质量又是生产管线的直接产物addPhoto → imageDescription → ollamaInference的输出格式还是问答准确率的上限约束llamaFind只基于描述作答。理解了这份样本的字段来源与对比逻辑也就理解了这套开源智能眼镜端侧描述 云侧推理的完整技术骨架。【免费下载链接】FriendAI that sees your screen, listens to your conversations and tells you what to do项目地址: https://gitcode.com/GitHub_Trending/fr/Friend创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考