Итоговая оценка помогает сократить список моделей для дальнейшей проверки. Она не определяет универсального победителя: модель, которая лидирует по совокупности показателей, может уступать конкурентам в программировании, работе с документами или стоимости использования.
В рейтинге учитываются три группы данных:
- результаты независимых тестов;
- пользовательские оценки;
- качество работы с русским языком.
Подробный список источников, порядок нормализации результатов и веса показателей должны быть опубликованы вместе с утверждённой методологией. Без этого итоговый балл нельзя считать проверяемым.
Разницу в несколько десятых балла не стоит переоценивать. Модели с близкими результатами лучше рассматривать как одну группу и сравнивать уже на конкретной задаче.
Рейтинг показывает конкретные версии ИИ-моделей. Он не сравнивает приложения целиком. Загрузка файлов, веб-поиск, память, выполнение кода и другие функции могут зависеть от сервиса, тарифа и подключённых инструментов.
Дата рядом с таблицей показывает, когда позиции обновлялись в последний раз.