Да, похоже, что Cohere развивает и предлагает мультимодальные модели общего назначения, не ограничиваясь только встраиваниями (embeddings).
В частности, упоминается модель Command A Vision, которая позиционируется как современная мультимодальная модель ИИ, разработанная для корпоративного использования и объединяющая расширенные возможности работы с изображениями. Также в их описаниях говорится о «высокопроизводительных моделях для агентного, мультимодального, многоязычного ИИ». Это указывает на то, что Cohere стремится к созданию более широкого спектра мультимодальных решений.