Open-source ИИ / Брифинг по ИИ

AWS использует SkyRL для повышения показателей навигации по лабиринтам моделью Qwen3-VL-8B

Исследователи AWS обучили зрительно-языковую модель Qwen3 решать визуальные лабиринты с точностью свыше 95% с помощью открытого фреймворка обучения с подкреплением SkyRL.

Обложка публикации AWS: AWS использует SkyRL для повышения показателей навигации по лабиринтам моделью Qwen3-VL-8B
Из AWS MLОригинальная обложка публикации AWS.

AWS продемонстрировала обучение мультимодальной модели (vision-language) Qwen3-VL-8B с использованием опенсорсного фреймворка SkyRL на платформе SageMaker HyperPod. Применив Group Relative Policy Optimization на этапе постобучения к чекпоинту, полученному методом контролируемого дообучения (supervised fine-tuning), исследователи увеличили долю успешного прохождения визуальных лабиринтов моделью с 43,75% до более чем 95% на фиксированном наборе для оценки.

Обучение с подкреплением для мультимодальных моделей (vision-language)

В процессе обучения использовался метод Group Relative Policy Optimization для доработки модели Qwen3-VL-8B, начальной точкой для которой послужил чекпоинт контролируемого дообучения (supervised fine-tuning). Этот многошаговый подход к обучению с подкреплением позволяет агенту обучаться на основе вознаграждений, накапливаемых за всю последовательность шагов внутри визуального лабиринта, а не получать обратную связь только за отдельные действия.

Для управления высокими вычислительными нагрузками при таких многоузловых запусках фреймворк развертывался на Amazon SageMaker HyperPod. Эта инфраструктура использует функции отказоустойчивости кластера для мониторинга состояния узлов и автоматической замены неисправного оборудования, что позволяет длительным заданиям обучения с подкреплением возобновлять работу с контрольных точек (чекпоинтов), а не перезапускаться с нуля после сбоя.

Результаты оценки и инфраструктурные ограничения

Тестирование, проведенное на фиксированном наборе для оценки из 64 лабиринтов, показало, что постобучение методом обучения с подкреплением значительно повысило эффективность по сравнению с базовым уровнем. Доля успешных решений выросла с 43,75% до более чем 95%. Система интегрируется с кластерами Ray и использует управляемые дашборды для мониторинга динамики обучения и наблюдаемости.

Заявленный успех основан на конкретном, фиксированном наборе из 64 лабиринтов. В источнике не приводятся данные об эффективности в ранее не встречавшихся или процедурно генерируемых средах за пределами этого набора для оценки. Хотя инфраструктура поддерживает крупномасштабные рабочие нагрузки, продолжительность обучения и общее количество часов работы GPU, потребовавшихся для получения этих результатов, указаны не были.

Первоисточник

В этом отчете кратко изложен материал указанного ниже источника. Аналитика приводится отдельно; заявления о продуктах и исследованиях атрибутируются их авторам.

Читать оригинал на AWS ML

← Назад ко всем новостям ИИ