24 серпня Мінцифри разом з Українським католицьким університетом і спільнотою lang-uk відкрили Ukrainian LLM Leaderboard — перший публічний рейтинг того, як мовні моделі працюють з українською: перекладають, стискають тексти, шукають відповідь у документі, розв’язують задачі рівня ЗНО. Але в таблиці немає ні GPT, ні Claude, ні Gemini: комерційні API розробники рейтингу лише планують додати.
Тому для бізнесу рейтинг корисний в іншому: він показує, які відкриті моделі — ті, що можна розгорнути на власному сервері, не передаючи дані назовні, — справляються з українськими документами. Розбираємо, що саме він вимірює, як читати результати і як за один день перевірити модель на власних текстах.
Що вимірює рейтинг ШІ-моделей Мінцифри
Рейтинг зробив центр компетенцій WINWIN AI при Мінцифри разом з УКУ та lang-uk, а технічною основою став лідерборд, який команда Lapa LLM використовувала під час розробки власної моделі. Результати відкриті на Hugging Face, код оцінювання — на GitHub, тож будь-хто може повторити тест на своєму залізі.
Моделі перевіряють на наборах завдань, перекладених або зібраних українською. Для бізнесу з них важливі не всі, а кілька груп:
- Переклад англійська ↔ українська (FLORES, WMT-22) — якщо модель має готувати листи партнерам або локалізувати документацію.
- Стискання тексту й відповіді за документом (XLSUM, Belebele, SQuAD) — розробники самі називають цю пару наближеною оцінкою того, як модель працюватиме в пошуку по внутрішній базі знань.
- Виконання інструкцій (IFEval) — чи тримає модель заданий формат: таблицю, довжину, структуру відповіді.
- Логіка й знання — задачі ЗНО, MMLU, математика GSM-8K.
Окрема вкладка присвячена упередженості: наскільки модель відтворює стереотипи у виборі відповідей. Розробники прямо попереджають, що це не загальна оцінка етичності, а вимір лише одного типу помилок.
Чого в рейтингу поки немає
Найпомітніша прогалина — комерційні моделі. У дорожній карті проєкту окремим пунктом стоїть «додати API-провайдерів (OpenAI, Anthropic, Google)», тобто ChatGPT, Claude і Gemini ще не оцінені. Якщо ваша команда вже працює з ними, рейтинг не скаже, яка з них краще пише українською.
Також у планах — оцінка роботи із зображеннями, вартості використання українською (скільки токенів «з’їдає» кирилиця в різних моделях) і окремі тести на адміністративні процедури, нормативні тексти та персональні дані. Саме ці пункти найцікавіші для бізнесу, тож рейтинг варто перевіряти повторно через кілька місяців.
Хто серед лідерів і що це означає
Серед моделей з найкращими результатами профільні медіа називають дві, зроблені спеціально під українську.
Lapa LLM — модель дослідників з УКУ, Львівської політехніки, КПІ та AGH University of Krakow, публічно випущена наприкінці жовтня 2025 року. В основі — Gemma-3-12B від Google, але токенізатор переписали під українську: замінили 80 тисяч із 250 тисяч токенів, тож той самий текст модель обробляє швидше. Ліцензія дозволяє комерційне використання. За даними профільних медіа, версія lapa-v0.1.2-instruct має одні з найкращих результатів у перекладі.
MamayLM — модель болгарського інституту INSAIT, створена разом із дослідниками ETH Zurich. Перша версія вийшла у квітні 2025 року на базі Gemma 2 9B і працює на одній відеокарті. На задачах ЗНО розробники зафіксували кращий результат, ніж у значно більших Gemma 2 27B і Llama 3.1 70B. Пізніші версії моделі, за повідомленнями медіа, мають сильні результати в перекладі й логічних тестах.
Практичний висновок: модель розміром 9–12 мільярдів параметрів, донавчена на українських даних, може працювати з українськими текстами не гірше за вдвічі-втричі більші універсальні моделі. Для компанії це різниця між орендою одного сервера з відеокартою і кластера — тобто між проєктом, який окупається, і проєктом, який лишається експериментом.
Відкрита модель чи API: що обрати бізнесу
Рейтинг не відповідає на головне питання — чи потрібна вам власна модель узагалі. Ось як ці два шляхи відрізняються на практиці:
| Критерій | Відкрита модель на своєму сервері | Комерційна модель через API |
|---|---|---|
| Де лишаються дані | У вашій інфраструктурі | Передаються провайдеру за його умовами |
| Витрати | Сервер з відеокартою та адміністрування, незалежно від навантаження | Оплата за обсяг запитів, старт без інфраструктури |
| Якість українською | Видно в рейтингу Мінцифри | Поки не оцінена в рейтингу, треба тестувати самостійно |
| Коли підходить | Договори, медичні чи фінансові дані, великий стабільний обсяг | Пілот, змінне навантаження, складні задачі |
Для більшості малих компаній старт через API або готового асистента дешевший і швидший — про рівні такої інтеграції ми писали в розборі того, де AI для бізнесу окупається. Відкрита модель виправдана, коли дані не можна віддавати назовні або коли обсяг запитів настільки великий, що власний сервер виходить дешевшим за рахунки провайдера.
Як перевірити модель на своїх текстах за один день
Рейтинг показує середню температуру по лікарні. Ваші документи — зі своєю термінологією, скороченнями й канцеляритом — можуть дати інший результат. Короткий тест, який не потребує розробників:
- Зберіть 20–30 реальних завдань з однієї робочої задачі: листи клієнтам, резюме договорів, відповіді на типові запити. Приберіть з них персональні дані.
- Запишіть еталон — як відповів би ваш найкращий працівник. Без еталона порівняння перетворюється на суперечку про смаки.
- Проженіть завдання через 2–3 моделі: одну-дві відкриті з рейтингу (їх можна запустити в тестовому середовищі на Hugging Face або локально) і ту комерційну, якою вже користуєтесь.
- Оцініть наосліп: хай двоє працівників ставлять бали відповідям, не знаючи, яка модель їх дала. Рахуйте окремо фактичні помилки і стиль.
Якщо відкрита модель на ваших текстах відстає від комерційної незначно, а дані чутливі, — це аргумент на користь власного розгортання. Якщо різниця велика, тест уже окупився: ви дізнались це до купівлі сервера.
Що далі
Рейтинг з’явився в момент, коли в Україні готують профільний закон про ШІ — які практики він може заборонити, ми розбирали в матеріалі про закон про ШІ і обов’язки бізнесу. Коли до рейтингу додадуть комерційні моделі й тести на роботу з персональними даними, він стане повноцінним інструментом вибору. Поки що це найкращий відкритий орієнтир для тих, хто думає про власну модель, — і хороший привід провести власний тест на реальних документах.