Результати пошуку для "RL"
27-11-2025 05:38
0

Prime Intellect випустила модель INTELLECT-3

Децентралізація AI протокол Prime Intellect запустив гібридну експертну модель INTELLECT-3 з 106B параметрами, яка базується на GLM 4.5 Air Base моделі та використовує SFT і RL для навчання. Prime Intellect цього року в березні завершив фінансування в 15 мільйонів доларів.
Більше
19-08-2026 13:34
0

ByteDance реорганізовує команду Seed у чотири підрозділи, об’єднуючи напрямки попереднього навчання та RL

За даними Beating AI, команда Seed Foundation Model у ByteDance завершила організаційну реструктуризацію, створивши чотири нові підрозділи. Реструктуризація об’єднала раніше розподілені команди з підготовки даних для попереднього навчання та навчання з підкріпленням у сферах тексту, коду, комп’ютерного зору й мовлення в уніфіковані підрозділи: Pretrain Data (мультимодальні дані), Horizon RL (навчання з підкріпленням), Product Posttrain-Work (оптимізація для офісних і B2B-застосунків) та Product
Більше
03-08-2026 01:44
0

Bank of America рекомендує п’ять акцій із сильним імпульсом перед звітом Spotify 4 серпня

Згідно з Bank of America, компанія рекомендує п’ять акцій як помітні позиції, що можуть демонструвати сильний ціновий імпульс напередодні та після оголошень про прибутки 4 серпня й надалі: Spotify (SPOT), RB Global (RBA), Ralph Lauren (RL), DoorDash (DASH) і Cisco Systems (CSCO). BofA зберігає рекомендацію «покупати» для Spotify, посилаючись на прискорене зростання виручки в міру послаблення валютних зустрічних вітрів, і очікує, що цінова спроможність та продуктові роадмапи, підсилені ШІ, забезп
Більше
SPOT-1,01%
RBA-0,70%
RL-3,33%
DASH-1,55%
CSCO0,28%
13-07-2026 06:01
0

Prime Intellect випускає верифікатори 0.2.0, що відокремлюють визначення задачі від її виконання агентом

Платформа для навчання ШІ Prime Intellect, яка обіцяє перемогу, випустила Verifiers 0.2.0 та представила архітектуру Verifiers v1 наступного покоління. Verifiers — це фреймворк із відкритим кодом для тестування та оцінювання агентів ШІ, тоді як щойно відкритий prime-rl-фреймворк навчає моделі на основі результатів виконання задач. Архітектура v1 відокремлює визначення задачі, вибір інструментів і правила оцінювання (Taskset) від методів виконання агентом (Harness) та середовищ виконання (Runtime
Більше
06-07-2026 07:33
0

Tencent Hunyuan випускає Hy3 з покращеною продуктивністю інференції, ціна API від 1 юаня за мільйон токенів

Згідно з PANews, Tencent випустив Hunyuan Hy3 сьогодні (6 липня), який забезпечує продуктивність виведення та агента, порівнянну з більшими моделями з у 2–5 разів більшою кількістю параметрів. Модель, побудована на вдосконалених даних пост-тренування та розширених обчисленнях RL, тепер є відкритою за ліцензією Apache 2.0 на GitHub, HuggingFace та інших платформах. Ціни API Hy3 (за мільйон токенів): вхід — 1 юань, вихід — 4 юані, кешований вхід — 0,25 юаня. Tencent також знизив витрати на розгорт
Більше
TENCENT-1,24%
14-05-2026 00:21
0

Nvidia співпрацює з Ineffable Intelligence над RL-системами, поки AI-стартап залучає $1,1 млрд

За даними CNBC, Nvidia 13 травня партнеруватиме з лондонським AI-стартапом Ineffable Intelligence, щоб створити великомасштабні системи підкріпленого навчання. Ineffable, заснований колишнім науковцем Google DeepMind Девідом Сілвером, залучив 1,1 мільярда доларів у раунді seed у квітні під керівництвом Sequoia та Lightspeed за підтримки Nvidia і Google. Компанії використовуватимуть чипи Nvidia Grace Blackwell і платформу Vera Rubin, щоб створити інфраструктуру для AI-моделей, які навчаються на в
Більше
23-04-2026 04:54
0

Perplexity розкриває метод пост-тренування агента веб-пошуку; модель на базі Qwen3.5 перевершує GPT-5.4 за точністю та вартістю

Perplexity використовує SFT із подальшим RL із моделями Qwen3.5, застосовуючи багатокроковий набір даних для QA та перевірки за рубрикою, щоб підвищити точність і ефективність пошуку, досягаючи рівня FRAMES найвищого класу.
Анотація: Робочий процес пост-тренування Perplexity для агентів веб-пошуку поєднує контрольоване донавчання (SFT) для забезпечення дотримання інструкцій і мовної узгодженості з онлайн підкріплювальним навчанням (RL) через алгоритм GRPO. Етап RL використовує власний багатоходовий верифікований датасет запитань-відповідей і розмовні дані на основі рубрики, щоб запобігти дрейфу SFT, із обмеженням винагород і штрафами за ефективність у межах групи. Оцінювання показує, що Qwen3.5-397B-SFT-RL досягає найвищих показників FRAMES: 57,3% точності за одного виклику інструмента та 73,9% за чотирьох викликів при $0,02 за запит, випереджаючи GPT-5.4 і Claude Sonnet 4.6 за цими метриками. Ціноутворення базується на API і не включає кешування.
Більше
27-03-2026 04:37
0

Cursor кожні 5 годин ітерує Composer: в умовах реального часу RL навчання модель навчилася «прикидатися дурнем, щоб уникнути покарання».

AI-платформа для програмування Cursor випустила методи реального підкріплювального навчання в режимі часу, перетворюючи взаємодії з реальними користувачами на сигнали для тренування, щоб покращити продуктивність моделі та зменшити відхилення розподілу. Незважаючи на те, що підхід є ефективним, він також підвищує ризик «reward hacking». Cursor вирішує ці проблеми через моніторинг і коригування функції винагороди.
Більше
25-03-2026 06:36
0

Cursor опублікував технічний звіт Composer2: середовище RL повністю імітує реальні сценарії користувачів, оцінка базової моделі підвищилася на 70%

Cursor опублікував технічний звіт Composer 2, який описує повний план навчання його архітектури Kimi K2.5 MoE, включаючи двофазове навчання та власний еталон CursorBench. Після навчання продуктивність Composer 2 значно покращилася і показує переваги в плані витрат на інференцію порівняно з іншими передовими моделями.
Більше
30-12-2024 07:06
0

Лінчу Інтелект випускає першу повністю втілену модель Psi R0

Інформація від 30 грудня від компанії Ling Chu Intelligence повідомляє про випуск першої моделі PsiR0, яка базується на підсиленому навчанні (RL) та має здатність до кінцевого до кінця моделювання з врахуванням фізичного тіла. Ця модель дозволяє двом рукам співпрацювати виконуючи складні дії, поєднувати кілька навичок та генерувати інтелектуальний агент з можливістю міркування, щоб завершити довгострокові завдання з використанням складних дій. Крім того, PsiR0 може реалізовувати узагальнення на рівні між об'єктами та сценами.
Більше
PSI0,20%