Вивчай
AI

AI-терміни: словник українською

Словник AI-термінів українською — картотека понять зі світу штучного інтелектуСловник AI-термінів українською — картотека понять зі світу штучного інтелекту

Проблема зі світом AI не в тому, що він складний. Проблема в тому, що там говорять сотнею англійських слів, половина яких означає одне й те саме, а друга половина звучить однаково, але означає різне.

Ця сторінка розкладає все по поличках. Почни згори — терміни йдуть від базових до складніших, і кожен наступний спирається на попередні.

Якщо хочеш спершу загальну картину, а не окремі визначення — почни з програми курсу, а про свідоме використання AI у навчанні є окрема стаття.


1. Фундамент — що таке що

Тут головна плутанина новачків: ці слова не синоніми, вони вкладені одне в одне як матрьошка.

ТермінПростими словами
Штучний інтелект (AI)Найширше поняття: будь-яка система, що робить речі, які раніше вимагали людини. Сюди входить усе інше в цій таблиці
Машинне навчання (ML)Підхід, коли програму не програмують правилами, а показують приклади, і вона виводить правила сама
НейромережаОдин із методів ML: числа, організовані шарами, що передають сигнал одне одному — дуже грубо за мотивами нейронів мозку
Глибоке навчання (Deep Learning)Нейромережі з багатьма шарами. «Глибоке» — це буквально про кількість шарів
МодельРезультат навчання: файл із числами, який уміє щось передбачати. Не програма і не база даних
AGIГіпотетичний загальний ІІ, який уміє все, що людина. Поки не існує; усе, з чим ти працюєш, — вузькі системи

Модель — детально

Модель — це не сховище відповідей, а натренована інтуїція.

Уяви людину, яка прочитала величезну бібліотеку, а потім здає іспит без конспектів. Книжок при собі немає — є лише те, що осіло в голові. Модель так само: у ній немає текстів, на яких її вчили, є тільки «відчуття», які слова зазвичай ідуть за якими.

Фізично модель — це файл із числами. Коли кажуть «модель на 70 мільярдів», мають на увазі 70 мільярдів параметрів.

ТермінПростими словами
ПараметриКількість «ручок» усередині моделі. Пишуть як 7B, 70B, 405B — B це мільярди (billion)
Ваги (weights)Власне значення цих ручок — те, що змінюється під час навчання. «Ваги моделі» = сам файл моделі
Шар (layer)Один поверх обчислень. Дані проходять крізь десятки-сотні шарів по черзі
АрхітектураКреслення моделі: скільки шарів, як вони з'єднані. Ваги — начинка, архітектура — форма
ЧекпойнтЗбережений стан моделі на певному етапі навчання
Інфо

Більше параметрів ≠ розумніша модель. Модель на 7B, навчена на хороших даних, регулярно обходить стару на 70B. Розмір — це не якість, а стеля можливої якості.


2. Як модель бачить текст

ТермінПростими словами
ТокенШматочок тексту, яким оперує модель. Зазвичай не літера і не слово, а щось між: частина слова
ТокенізаціяПроцес різання тексту на токени перед обробкою
Ембединг (embedding)Перетворення токена на список чисел (вектор), де близькі за змістом слова мають близькі числа
ВекторПросто список чисел, що описує зміст. «Кіт» і «кішка» будуть поруч, «кіт» і «екскаватор» — далеко
Контекстне вікноСкільки токенів модель здатна тримати перед очима за раз: твоє питання + історія + документи + її відповідь
Промпт (prompt)Те, що ти надсилаєш моделі. Весь текст запиту
Інференс (inference)Момент, коли модель працює і видає відповідь. Протилежність навчанню

Токен — детально

Модель не бачить букв. Вона ріже текст на шматочки, і для української це важливо.

Грубе правило: одне англійське слово ≈ 1 токен, одне українське слово ≈ 2–3 токени. Кирилиця розпадається на дрібніші шматки, бо більшість моделей тренували переважно на англійських текстах.

Практичні наслідки:

  • Запит українською коштує дорожче за той самий запит англійською — інколи вдвічі.
  • Ліміт контексту в токенах українською вичерпується швидше.
  • Модель гірше рахує букви в словах — вона їх просто не бачить окремо. Звідси класичний провал із питанням «скільки букв «р» у слові».

Контекстне вікно — детально

Це робочий стіл моделі, а не її пам'ять.

Усе, що не лежить на столі просто зараз, для моделі не існує. Кожне нове повідомлення в чаті — це насправді пересилання всієї попередньої розмови наново. Тому:

  • довга розмова дорожчає з кожним кроком;
  • коли вікно переповнюється, найстаріше випадає — модель «забуває» початок;
  • модель не пам'ятає вчорашню сесію, якщо застосунок не підсунув їй конспект.

Розміри вимірюють у токенах: 8K, 128K, 1M. Мільйон токенів — приблизно як кілька товстих книжок одночасно.

Увага

Велике вікно не означає, що модель однаково уважна до всього. Є ефект «загубленого посередині»: те, що лежить на початку й у кінці промпту, помічається краще за середину. Найважливіше клади в кінець.


3. Архітектури

ТермінПростими словами
Трансформер (Transformer)Архітектура 2017 року, на якій побудовані всі сучасні мовні моделі. Головна ідея — механізм уваги
Увага (attention)Здатність моделі вирішувати, на які слова в тексті дивитися уважніше при обробці поточного
Self-attentionУвага тексту до самого себе: кожне слово «озирається» на всі інші в контексті
Енкодер / декодерДві половини трансформера: одна розуміє вхід, друга генерує вихід. Чат-моделі — переважно самі декодери
MoE (Mixture of Experts)Модель із багатьох підмоделей-«експертів», з яких на кожен токен вмикаються лише кілька
Дифузійна модельАрхітектура для картинок і відео: починає з шуму і поступово «проявляє» зображення
GANСтаріший підхід до генерації: дві мережі змагаються — одна малює, друга ловить підробки
CNNЗгорткова мережа, класика для розпізнавання зображень
RNN / LSTMПопередники трансформера для послідовностей. Читали текст строго по черзі, тому були повільні

MoE — детально

Уяви поліклініку замість одного лікаря-універсала. На вході сидить реєстратура, яка дивиться на запит і відправляє його до двох-трьох профільних спеціалістів із сотні наявних.

Результат: модель має, скажімо, 400 мільярдів параметрів загалом, але на кожен токен працюють лише 30 мільярдів активних. Якість як у великої, швидкість і ціна ближчі до малої.

Тому в описах моделей часто пишуть два числа: total parameters і active parameters. Друге визначає, скільки це коштує й наскільки швидко працює.


4. Як моделі навчають

ТермінПростими словами
Претренування (pre-training)Основний і найдорожчий етап: модель читає гігантські обсяги тексту й учиться вгадувати наступний токен
Fine-tuningДотренування готової моделі на вужчих даних під конкретну задачу чи стиль
LoRAДешевий fine-tuning: замість правки всієї моделі додається крихітна «накладка»
RLHFНавчання з підкріпленням на людських оцінках: людям показують пари відповідей, вони обирають кращу, модель підлаштовується
ДистиляціяВелика модель-учитель навчає маленьку модель-учня імітувати себе
КвантизаціяСтиснення: числа зберігають грубіше (int8, int4) — файл менший, швидкість вища, якість трохи падає
Прунінг (pruning)Вирізання зв'язків, які майже не впливають на результат
ДатасетНабір даних для навчання
Синтетичні даніДані, згенеровані іншою моделлю, а не зібрані з реального світу
Loss (функція втрат)Число, що показує, наскільки модель помилилася. Мета навчання — зробити його меншим
Градієнтний спускМетод, яким підкручують ваги: маленькими кроками в бік меншої помилки
ЕпохаОдин повний прохід по всьому датасету
Перенавчання (overfitting)Модель визубрила навчальні приклади, але провалюється на нових
Data cutoffДата, після якої модель нічого не знає — межа її навчальних даних

Base vs Instruct — важлива відмінність

ТипЩо цеЯк поводиться
BaseСира модель одразу після претренуванняПросто продовжує текст. На питання може відповісти списком схожих питань
Instruct / ChatBase після дотренування на діалогах і RLHFВиконує вказівки, відповідає по суті, вміє відмовляти

Практично всі моделі, з якими ти стикаєшся, — instruct-версії. Base-версії викладають для тих, хто хоче тренувати щось своє.


5. Типи моделей

ТермінПростими словами
LLMВелика мовна модель — те, що зазвичай мають на увазі під «AI»
SLMМала мовна модель: компактна, працює на телефоні чи ноутбуці без інтернету
МультимодальнаРозуміє не лише текст, а й зображення, звук, відео
VLMVision-Language Model: модель, що бачить картинки й говорить про них
Foundation modelВелика універсальна модель-основа, на базі якої роблять вужчі рішення
Reasoning modelМодель, навчена «думати» довше перед відповіддю, розписуючи хід міркувань
Embedding-модельНе генерує текст, а перетворює його на вектори. Основа пошуку за змістом
RerankerМодель, що переупорядковує знайдені документи за релевантністю
TTS / STTСинтез мовлення з тексту / розпізнавання мовлення в текст
Text-to-image / Text-to-videoГенерація зображень і відео з текстового опису

Open-weight, open-source, closed — три різні речі

Це плутають постійно, хоча різниця принципова.

ТипЩо даютьЩо можеш робити
Closed (закрита)Тільки доступ по APIНадсилати запити. Ваг не бачиш
Open-weight (відкриті ваги)Файл моделі для завантаженняЗапускати у себе, дотренувати. Але не знаєш, на чому її вчили
Open-source (справді відкрита)Ваги + код + опис данихУсе вищеперелічене плюс можеш відтворити навчання з нуля

Більшість «відкритих» моделей насправді open-weight, а не open-source: ваги дають, а склад навчальних даних — ні.


6. Як із моделями працюють

ТермінПростими словами
System promptПрихована інструкція, що задає моделі роль і правила ще до твого повідомлення
Zero-shotПросиш зробити задачу без жодного прикладу
Few-shotДаєш 2–5 прикладів «вхід → правильний вихід», і модель схоплює патерн
Chain-of-thoughtПросиш розписати міркування покроково — на логічних задачах помітно піднімає точність
Промпт-інжинірингМистецтво формулювати запити так, щоб отримувати потрібне стабільно
RAGПошук потрібних документів + підкладання їх у промпт, щоб модель відповідала по твоїх даних
Векторна базаСховище ембедингів, у якому шукають за змістом, а не за збігом слів
Function calling / Tool useМодель не виконує дію сама, а каже застосунку: виклич таку функцію з такими аргументами
MCPВідкритий протокол, що стандартизує підключення інструментів і даних до моделі
АгентМодель у циклі: планує, викликає інструменти, читає результат, коригує себе — до досягнення мети
GuardrailsЗахисні перевірки навколо моделі: фільтри вводу й виводу
TemperatureРегулятор випадковості: 0 — передбачувано й сухо, вище — креативніше й ризикованіше
Top-p / top-kІнші способи обмежити вибір наступного токена
StreamingВіддача відповіді по словах одразу, а не цілим блоком у кінці

RAG — детально

RAG = Retrieval-Augmented Generation, тобто «генерація, підсилена пошуком».

Проблема: модель не знає твоїх внутрішніх документів і не знає нічого після своєї data cutoff. Дотренувати її на кожну зміну — дорого й повільно.

Рішення в три кроки:

  1. Твої документи ріжуть на шматки й перетворюють на вектори — складають у векторну базу.
  2. Коли приходить питання, його теж перетворюють на вектор і шукають найближчі шматки.
  3. Знайдене підкладають у промпт: «ось витяги з документів, відповідай на їх основі».

Модель при цьому не вчиться — їй просто щоразу підсовують шпаргалку.

Агент — детально

Різниця між чатом і агентом — це різниця між консультантом і виконавцем.

Чат: ти питаєш → модель відповідає → кінець. Один крок.

Агент: ти ставиш мету → модель складає план → викликає інструмент (читає файл, запускає команду, шукає в мережі) → дивиться результат → вирішує, що далі → повторює, доки не закінчить.

Саме через цей цикл агенти витрачають у десятки разів більше токенів, ніж звичайний чат.


7. Проблеми й обмеження

ТермінПростими словами
ГалюцинаціяМодель упевнено вигадує факт, посилання чи функцію, якої не існує
Bias (упередження)Перекоси з навчальних даних, які модель відтворює у відповідях
AlignmentРобота над тим, щоб модель діяла відповідно до намірів людей
ДжейлбрейкОбхід обмежень моделі хитрим формулюванням
Prompt injectionАтака, коли шкідлива інструкція захована у даних, які модель читає — у документі чи на сторінці
SycophancyСхильність погоджуватися з користувачем замість того, щоб заперечити
Model collapseДеградація моделей, натренованих переважно на згенерованих іншими моделями даних
Знання про межу знаньСлабке місце: модель погано відрізняє «я знаю» від «я не знаю»

Чому виникають галюцинації

Це не баг, а прямий наслідок конструкції.

Модель завжди обирає найімовірніше продовження тексту. У неї немає окремого механізму перевірки істинності — є лише правдоподібність. Правдоподібне й правдиве збігаються здебільшого, але не завжди.

Найчастіше ламається на:

  • точних цифрах, датах, цитатах;
  • назвах бібліотек і методів (особливо свіжих);
  • посиланнях — URL виглядає ідеально й веде в нікуди;
  • вузьких темах, яких у навчальних даних було мало.

Правило: усе, що можна перевірити за півхвилини, перевіряй за півхвилини.


8. Метрики й бенчмарки

ТермінПростими словами
БенчмаркСтандартний набір задач для порівняння моделей між собою
Elo / ArenaРейтинг за результатами «дуелей»: людям показують дві анонімні відповіді, вони обирають кращу
MMLUШирокий тест знань із десятків шкільних і вишівських предметів
GPQAСкладні питання рівня аспірантури з природничих наук
SWE-benchРеальні баги з GitHub: чи здатна модель полагодити їх у справжньому репозиторії
HumanEvalКласичний тест генерації коду за описом функції
HLEHumanity's Last Exam — навмисно дуже складний набір питань
pass@kЧастка задач, розв'язаних хоча б однією з k спроб
Latency / TTFTЗагальна затримка / час до першого токена — наскільки швидко починає відповідати
ThroughputПропускна здатність: скільки токенів за секунду видає
КонтамінаціяСитуація, коли тестові задачі випадково потрапили в навчальні дані — оцінка стає завищеною
Увага

До цифр у бенчмарках стався скептично. Лабораторії показують тести, на яких виглядають добре, а контамінація — поширена проблема. Надійніше дивитися на «дуельні» рейтинги на кшталт Arena і на власний тест із трьох-п'яти своїх реальних задач.


9. Залізо, гроші й масштаб

ТермінПростими словами
GPUВідеокарта. Основне залізо для навчання й запуску моделей
TPUВласні чипи Google під ті самі задачі
NPUМаленький чип для нейромереж у телефонах і ноутбуках — дає локальний AI без інтернету
VRAMПам'ять відеокарти. Головне обмеження: модель має в неї вміститися
FLOPОдна арифметична операція. Обсяг навчання вимірюють у величезних числах на кшталт 1e26
ComputeЗагальна кількість обчислень — ключовий ресурс усієї галузі
Scaling lawsЕмпіричні закони: якість передбачувано росте з розміром моделі, обсягом даних і обчисленнями
Кеш промптуПовторне використання вже обробленої частини промпту — суттєво здешевлює довгі діалоги
Ціна за мільйон токенівСтандартна одиниця тарифікації. Вхідні токени майже завжди дешевші за вихідні
Rate limitЛіміт кількості запитів чи токенів за проміжок часу
Батч (batch)Пакетна обробка багатьох запитів разом — дешевше, але повільніше

Чому вхід дешевший за вихід

Вхідний промпт модель обробляє паралельно — усі токени одразу. Вихід вона генерує послідовно, по одному токену, і кожен наступний вимагає нового проходу крізь усю мережу.

Звідси практичний висновок: довгий промпт коштує недорого, а довга відповідь — дорого. Якщо просиш стислість, ти економиш не лише свій час.


10. Хто є хто

ГравецьКраїнаЧим відомий
OpenAIСШАМоделі GPT, ChatGPT — те, що зробило AI масовим
AnthropicСШАМоделі Claude, сильні в коді й довгих агентних задачах
Google DeepMindСША / БританіяМоделі Gemini, генерація відео, наукові прориви
Meta AIСШАМоделі Llama — свого часу головна відкрита сімʼя
xAIСШАМоделі Grok
Mistral AIФранціяГоловний європейський гравець, відкриті ваги
DeepSeekКитайВідкриті моделі з різким співвідношенням ціна/якість
Alibaba (Qwen)КитайНайширша екосистема відкритих моделей
Moonshot (Kimi)КитайСильні агентні відкриті моделі
Zhipu (GLM)КитайОдин із лідерів серед відкритих ваг

Як цим користуватися

Не намагайся вивчити все одразу. Тримай сторінку у закладках і повертайся, коли зустрінеш незнайоме слово.

Мінімальний набір, який варто розуміти вже зараз, якщо ти тільки починаєш: токен, контекстне вікно, галюцинація, промпт, агент. Цих п'яти вистачає, щоб свідомо користуватися будь-яким AI-інструментом і не наступати на типові граблі.

Далі — як не зіпсувати собі навчання за допомогою AI, а якщо хочеш розібратися в самій розробці — програма курсу безкоштовна й починається з нуля.