Meta: Llama 3.2 90B Vision Instruct
- 128K Context
- 0.35/M Input Tokens
- 0.4/M Output Tokens
- 0.506/K Image Tokens
- Meta Llama
- Text image 2 text
- 02 Dec, 2024
The Llama 90B Vision 模型是一个顶尖的、拥有 90 亿参数的多模态模型,旨在应对最具挑战性的视觉推理和语言任务。它在图像描述、视觉问答和高级图像-文本理解方面提供无与伦比的准确性。该模型在庞大的多模态数据集上进行预训练,并通过人类反馈进行微调,专为处理最苛刻的基于图像的 AI 任务而设计。
该模型非常适合需要尖端多模态 AI 能力的行业,特别是那些处理复杂实时视觉和文本分析的行业。
点击此处查看 原始模型卡。
使用此模型须遵循 Meta 的可接受使用政策。