авг. 06, 2026
2017 жылғы «Attention Is All You Need» мақаласы GPT-тен Claude мен DeepSeek-ке дейінгі дерлік барлық заманауи LLM негізіне жатты. Attention механизмін талдаймыз....
авг. 06, 2026
Статья 2017 года «Attention Is All You Need» легла в основу почти всех современных LLM — от GPT до Claude и DeepSeek. Разбираем механизм Attention....
авг. 05, 2026
DeepSeek-V3 моделінің 671 млрд параметрі бар, бірақ әр токенге небәрі 37 млрд-ы жұмыс істейді. Mixture of Experts архитектурасын талдаймыз....
авг. 05, 2026
DeepSeek-V3 весит 671 млрд параметров, но на каждый токен считает только 37 млрд. Разбираем архитектуру Mixture of Experts....
авг. 04, 2026
Модельдерді дистилляциялау деген не? Үлкен модельдің білімі шағын модельге беріледі — 1,5 млрд параметрі бар модель математикадан GPT-4o-дан озып кетеді....
авг. 04, 2026
Дистилляция передаёт знания огромной модели компактной. Модель в 1,5 млрд параметров обгоняет GPT-4o на олимпиадной математике....