Tsinghua KEG Lab и Zhipu AI совместно запустили CogAgent, большую модель понимания изображений

2023-12-28 08:27:29

Bit News: Tsinghua KEG Lab недавно сотрудничала с Zhipu AI, чтобы совместно запустить новое поколение CogAgent для понимания изображений больших моделей. Основанная на ранее запущенном CogVLM, модель использует визуальные модальности вместо текста, чтобы обеспечить более полное и непосредственное восприятие интерфейса GUI через визуальный агент GUI для планирования и принятия решений. Сообщается, что CogAgent может принимать ввод изображений высокого разрешения 1120×1120, с визуальным ответом на вопросы, визуальным позиционированием (Grounding), GUI Agent и другими возможностями, в 9 классических списках понимания изображений (включая VQAv2, STVQA, DocVQA, TextVQA, MM-VET, POPE и т.д.) достиг первого результата в общей способности.

VET1.06%

Посмотреть Оригинал

На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .

Награда
лайк
комментарий
Репост
Поделиться

комментарий

0/400

Нет комментариев

Тема
#July PPI Beats Expectations
26957 Популярность
#ETH ETFs Top $30B
27203 Популярность
#Gate Alpha Peak Trading Competition
145117 Популярность
#Gate Releases August Reserves Report
18074 Популярность
#BTC Hits New ATH
105364 Популярность

Закрепить

Карта сайта