Kimi открыла в исходном коде PerceptionBench — визуальный бенчмарк восприятия: GPT-5.6-Sol занимает первое место по точности, но прорыва выше 60% у моделей нет

robot
Генерация тезисов в процессе

PANews 29 июля, Kimi объявила о выпуске с открытым исходным кодом мультимодальной модели Kimi для оценки визуального восприятия PerceptionBench. Цель — разложить способности визуального восприятия на 10 атомарных навыков и оценивать их независимо, охватывая такие измерения, как визуальные связи, подсчёт, атрибуты, глубина и 3D, позиционирование, сравнение, распознавание на мелкозернистом уровне, интеграция контекста, OCR и распознавание галлюцинаций. Этот бенчмарк построен на основе неудачных кейсов из 42 существующих наборов оценок моделей: всего он включает 3 000 задач с вопросами, проверенными вручную; каждая задача проверяет только один навык визуального восприятия, без необходимости рассуждений или внешних знаний.

Результаты оценки показывают, что среди 16 ведущих мультимодальных моделей ни одна не достигает общей точности выше 60%. GPT-5.6-Sol заняла первое место с точностью 59,7%, далее следуют Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) и GPT-5.5 (55,8%) — в топ-5. В отчёте отмечается, что визуальные галлюцинации (Hallucination) остаются самым слабым навыком у всех моделей, и что у общей способности к восприятию по-прежнему есть значительный потенциал для улучшения.

Посмотреть Оригинал
На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .
  • Награда
  • комментарий
  • Репост
  • Поделиться
комментарий
Добавить комментарий
Добавить комментарий
Нет комментариев
  • Закреплено