Чи добре штучний інтелект розуміє українську мову? Чи правильно використовує відмінки, перекладає тексти та виконує складні інструкції? Відтепер це можна перевірити за допомогою Ukrainian LLM Leaderboard — національного рейтингу великих мовних моделей за якістю роботи з українською мовою.
Центр компетенцій WINWIN AI при Міністерстві цифрової трансформації України спільно з Українським католицьким університетом та ініціативою lang-uk створили відкриту платформу, яка дає змогу порівнювати мовні моделі за результатами стандартизованого тестування.
Штучний інтелект дедалі активніше використовують у державних сервісах, бізнесі, освіті та інших сферах. Водночас якість роботи різних моделей саме з українською мовою може суттєво відрізнятися.
Більшість міжнародних тестів традиційно зосереджені на англійській мові. Українську ж часто оцінювали за допомогою перекладу завдань, що не завжди дає змогу побачити реальні сильні та слабкі сторони моделей.
Ukrainian LLM Leaderboard допомагає заповнити цю прогалину. Він дає змогу:
«Після появи великих мовних моделей було незрозуміло, наскільки добре вони працюють з українською мовою: які їхні сильні та слабкі сторони, для яких завдань які моделі краще підходять і де досі є прогалини в якості роботи з українською. Метою створення українського лідерборду було дати відповідь на ці питання, зібравши наявні бенчмарки від спільноти українського NLP та створивши нові. Сподіваюся, наша ініціатива допоможе як бізнесу у виборі найкращих моделей, так і дослідникам у їхній роботі», — зазначає Юрій Панів, аспірант УКУ, керівник розробки мовної моделі для української мови Lapa.
Для оцінювання використовують завдання, наближені до реальних сценаріїв використання штучного інтелекту.
Зокрема, моделі перевіряють на здатність:
Такий підхід дає змогу оцінити не лише загальну якість моделі, а й те, наскільки добре вона справляється з конкретними типами завдань українською мовою.
Результати тестування, код і дані доступні громадськості на платформі Hugging Face. Це дає змогу користувачам переглядати результати, порівнювати моделі та ознайомлюватися з підходами до їх оцінювання.
Методологію тестування розробили експерти Українського католицького університету та спільноти lang-uk — Юрій Панів і Дмитро Чаплінський.
Команда має багаторічний досвід роботи з українською мовою в системах обробки природної мови (NLP), зокрема створенням корпусів текстів, мовних інструментів та моделей для української.
Розроблені підходи також використовувалися під час створення української мовної моделі Lapa LLM та були представлені на міжнародних наукових конференціях.
Ukrainian LLM Leaderboard — приклад співпраці держави, академічної спільноти та фахівців з обробки природної мови.
«Неможливо керувати процесами, які ти не вимірюєш. Ми вбудовуємо штучний інтелект у сервіси для мільйонів людей і маємо ухвалювати рішення на основі доказів, а не лише заяв виробників. Лідерборд робить якість роботи моделей з українською мовою публічною та вимірюваною», — зазначає Роман Кислий, Chief AI Officer у WINWIN AI Center of Excellence.
Команда планує розширювати можливості Ukrainian LLM Leaderboard. Серед наступних напрямів:
Окрему увагу планують приділити тому, як моделі працюють з адміністративними процедурами, нормативно-правовими текстами та чутливими даними.
Це дасть змогу краще оцінювати, які ШІ-рішення можуть бути корисними для державного сектору та за яких умов їх безпечно використовувати.
Переглянути рейтинг
Ознайомитися з результатами тестування та порівняти ШІ-моделі можна на платформі Hugging Face:
WINWIN AI Center of Excellence — центр компетенцій при Міністерстві цифрової трансформації України, який працює над розвитком державної AI-інфраструктури та портфеля ШІ-продуктів.
За матеріалами Мінцифри.