InternViT-300M-448px-V2_5

11个月前发布 26 00

收录时间：

2025-06-02

打开网站手机查看

InternViT-300M-448px-V2_5

打开网站

InternViT-300M-448px-V2_5是一个基于InternViT-300M-448px的增强版本，通过采用ViT增量学习与NTP损失（Stage 1.5），提升了视觉编码器提取视觉特征的能力，尤其是在大规模网络数据集中代表性不足的领域，如多语言OCR数据和数学图表等。该模型是InternViT 2.5系列的一部分，保留了与前代相同的“ViT-MLP-LLM”模型架构，并集成了新的增量预训练的InternViT与各种预训练的LLMs，如InternLM 2.5和Qwen 2.5，使用随机初始化的MLP投影器。

数据统计

Florence-VL

Florence-VL是一个视觉语言模型，通过引入生成式视觉编码器和深度广度融合技术，增强了模型对视觉和语言信息的处理能力。该技术的重要性在于其能够提升机器对图像和文本的理解，进而在多模态任务中取得更好的效果。Florence-VL基于LLaVA项目进行开发，提供了预训练和微调的代码、模型检查点和演示。

SigLIP2

SigLIP2 是谷歌开发的多语言视觉语言编码器，具有改进的语义理解、定位和密集特征。它支持零样本图像分类，能够通过文本描述直接对图像进行分类，无需额外训练。该模型在多语言场景下表现出色，适用于多种视觉语言任务。其主要优点包括高效的语言图像对齐能力、支持多种分辨率和动态分辨率调整，以及强大的跨语言泛化能力。SigLIP2 的推出为多语言视觉任务提供了新的解决方案，尤其适合需要快速部署和多语言支持的场景。

暂无评论

您必须登录才能参与评论！

立即登录

暂无评论...

InternViT-300M-448px-V2_5

数据统计

相关导航

Florence-VL

SigLIP2

暂无评论

网址

X（Twitter）

大米星球

UniFans引力圈

2265安卓网

夜色电影网

789影视导航

热门推荐