首页 > 科技周边 > 人工智能

让「GPT-4V」跑在手机上，这家中国大模型公司做到了

时间：2025-01-18 23:55:09 250浏览收藏

IT行业相对于一般传统行业，发展更新速度更快，一旦停止了学习，很快就会被行业所淘汰。所以我们需要踏踏实实的不断学习，精进自己的技术，尤其是初学者。今天golang学习网给大家整理了《让「GPT-4V」跑在手机上，这家中国大模型公司做到了》，聊聊，我们一起来看看吧！

面壁科技发布MiniCPM-V 2.6：端侧多模态能力超越GPT-4V

面壁科技近日发布了MiniCPM-V 2.6，这款端侧模型在单图、多图和视频理解等多模态核心能力上全面超越了GPT-4V，并在20B参数以下取得了SOTA成绩。 MiniCPM-V 2.6的单图理解能力甚至比肩Gemini 1.5 Pro和GPT-4o mini。

MiniCPM-V 2.6 的优势在于其高效的知识压缩：视觉token数量相比上一代降低30%，比同类模型低75%，从而实现了比GPT-4o高两倍的单token编码像素密度（token density）。这使得模型运行效率更高。

让「GPT-4V」跑在手机上，这家中国大模型公司做到了

端侧首发功能：实时视频理解与多图联合理解

MiniCPM-V 2.6 首次在端侧实现了实时视频理解，让模型能够实时“观看”真实世界，这对于实现具身智能和提升人机交互自然度至关重要。此外，它还能直接处理视频文件，自动总结重点信息，无需用户手动观看。

该模型还首次将多图联合理解和多图ICL（上下文少样本学习）功能集成到端侧。例如，它可以处理多张小票图片，自动识别金额并计算总和。

让「GPT-4V」跑在手机上，这家中国大模型公司做到了

强大的多模态推理能力

MiniCPM-V 2.6 展现了强大的多模态推理能力，能够理解梗图背后的含义，并进行复杂的逻辑推理。例如，它可以根据多张图片和文字信息，推断出“WFH员工”的真实工作状态。

让「GPT-4V」跑在手机上，这家中国大模型公司做到了

MiniCPM-V 2.6 还支持多图ICL，能够快速适应特定领域和任务，提高输出稳定性。它可以根据给定的示例，学习“答题模板”，并给出符合逻辑的答案。

让「GPT-4V」跑在手机上，这家中国大模型公司做到了

性能指标与技术优势

MiniCPM-V 2.6 以8B参数实现了与GPT-4V相媲美的性能，在多个权威评测平台上取得了领先的成绩，包括OpenCompass、Mantis-Eval和Video-MME。其OCR性能也达到了开源和闭源模型的SOTA水平，并且幻觉率极低（8.2%）。

MiniCPM-V 2.6 的高性能源于其统一高清视觉架构，以及Ultra系列对齐技术，这使得模型能够高效地进行知识压缩和能力迁移。

让「GPT-4V」跑在手机上，这家中国大模型公司做到了

MiniCPM-V 2.6 的发布标志着端侧多模态大模型技术取得了显著进展，为AGI的实现迈出了重要一步。国内其他大模型团队也在积极发展多模态技术，例如上海人工智能实验室、联汇科技和商汤科技等。

理论要掌握，实操不能落！以上关于《让「GPT-4V」跑在手机上，这家中国大模型公司做到了》的详细介绍，大家都掌握了吧！如果想要继续提升自己的能力，那么就来关注golang学习网公众号吧！