Зміст
ByteDance готує титана: 10 трильйонів параметрів для конкуренції з лідерами ШІ
Китайський технологічний гігант ByteDance, відомий прежде всього як творець популярної соціальної мережі TikTok, робить амбіційну ставку на розвиток власних передових технологій штучного інтелекту. На відміну від деяких конкурентів, які віддають перевагу йти шляхом дистиляції існуючих розробок, ByteDance зосереджена на створенні самобутніх моделей. За повідомленнями Reuters, наразі команда розробників компанії активно працює над масштабною мовною моделлю (LLM) з безпрецедентною кількістю параметрів — 10 трильйонів.
Ця амбіційна розробка покликана вивести ByteDance на один рівень з лідерами в області генеративного ШІ, зокрема, з моделями сімейства Claude від американського стартапу Anthropic. Хоча Anthropic офіційно не розкриває точні дані про свої розробки, за неофіційною інформацією, їх флагманська модель Claude Mythos 5 налічує близько 8 трильйонів параметрів, а більш ранні версії, такі як Fable 5, — порядку 5 трильйонів. Важливо зазначити, що кількість параметрів є лише одним з факторів, що визначають можливості моделі. Воно безпосередньо пов’язане з обсягом даних, які модель здатна обробляти і зберігати, однак якість самої моделі, її продуктивність і ефективність в першу чергу залежать від якості навчальних даних і застосовуваних методів навчання.
Для порівняння, одна з найбільших китайських LLM, Kimi 3 від Moonshot, має трохи менше 3 трильйонів параметрів, і до недавнього часу вважалася лідером в КНР. Розробка моделі ByteDance з 10 трильйонами параметрів знаменує собою значний крок вперед для китайської індустрії ШІ.
Час і ресурси на шляху до досконалості
Процес створення такої масштабної LLM вимагає значних часових і ресурсних витрат. За відомостями з інсайдерських джерел, ByteDance знаходиться на етапі попереднього навчання моделі. Цей етап, відомий як претренінг, зазвичай займає від трьох до шести місяців. Тільки після завершення цього критично важливого етапу і подальшої тонкої настройки модель буде готова до публічного запуску.
Масштаб проекту підкреслюється і розміром команди, залученої до розробки. Близько 2000 висококваліфікованих спеціалістів, які працюють як в Китаї, так і за його межами, вносять свій внесок у створення цієї передової технології. У команду входять не тільки програмісти та інженери, але й наукові дослідники, спеціалісти з розмітки даних і перекладачі, що свідчить про комплексний підхід до розробки.
Засновник ByteDance, Чжан Імін, регулярно підкреслює важливість довгострокової стратегії компанії в області розвитку штучного інтелекту. Він мотивує співробітників, зазначаючи, що навіть тимчасове відставання від конкурентів не є приводом для смутку, якщо йдеться про досягнення стратегічної мети — створення власної потужної ШІ-моделі. ByteDance не просто прагне наздогнати найкращі західні розробки, але й має намір перевершити їх, пропонуючи світу нові можливості в сфері штучного інтелекту.
Варто згадати, що ByteDance активно розвиває й інші напрямки в області генеративного ШІ. Кілька тижнів тому компанія представила Seedance 2.5 — відеомодель, здатну генерувати 30-секундні відеокліпи в роздільній здатності 4K, що демонструє широкий спектр інтересів компанії в цій сфері.