ЯндексЯндекс

RL-инженер в команду локомоции человекоподобных роботов

Команда работает над обучением и внедрением политик локомоции в симуляции и на реальных платформах. Вы будете создавать среды, обучать RL-агентов в Isaac Lab/MuJoCo и переносить решения на роботов для устойчивого и безопасного движения

ГрейдSenior

Стек

PythonPyTorchIsaac LabMuJoCoIsaac GymPPOSACTD3C++CUDADiffusion Policy

Задачи

  • Разработка и обучение политик локомоции в симуляторах
  • Адаптация современных методов RL под задачи движения (Residual RL, Diffusion Policy)
  • Проектирование и усложнение физико-реалистичных сцен и сценариев
  • Формулирование гипотез, проведение экспериментов и валидация reward-функций
  • Анализ поведения агентов и улучшение метрик устойчивости
  • Перенос и тестирование обученных политик на реальных роботах

Обязательно

  • Опыт обучения RL-моделей и внедрения в продакшен или исследовательские пайплайны
  • Уверенное программирование на Python и работа с PyTorch
  • Знание кинематики и динамики роботов
  • Понимание и применение методов PPO, SAC, TD3 и других современных алгоритмов RL
  • Умение формулировать гипотезы и организовывать эксперименты
  • Опыт работы с Isaac Lab / Isaac Gym и MuJoCo
  • Чтение и внедрение идей из профильных научных публикаций

Будет плюсом

  • Знание C++ и/или CUDA для оптимизации симуляций
  • Опыт с Diffusion Policy и подходами типа Early Experience
  • Опыт работы с Residual RL
Откликнуться на сайте компании

Похожие вакансии

СОСоюзмультфильм

ИИ - Разработчик

PythonPyTorchOpenCVDocker

Модели и сервисы для автоматизации процессов анимации

Wildberries & RussWildberries & Russ

Middle ML Engineer

PythonPyTorchHuggingFacetransformers

LLM-инструменты и агенты для автоматизации бизнес-процессов

Опыт: от 3 лет
удалёнка, гибрид, Москва
ЯндексЯндекс

ML-разработчик в команду оптимизации архитектур и обучений модели планирования движения

PythonPyTorchCUDAFSDP

Инфраструктура и оптимизация обучения моделей планирования движения

СберСбер

LLM/ ML инженер на core агента (ДКА)

PythonLangChainVector databaseGigaChat

Платформа мультиагентных AI-агентов и инструментов

Опыт: 1–3 года
гибрид, Москва
МТСМТС

Middle Дата аналитик в Скоринг [Big Data, МТС Веб Сервисы]

PythonPySpark

ML-платформа для скоринга B2B-клиентов

гибрид, Москва
CHChoiceit

Middle/Senior Quantitive Researcher

PythonPyTorchNumPyscikit-learn

Системы сигналов и бэктестинга для торговых стратегий

Опыт: 3–6 лет
удалёнка

Смотреть ещё

JobsWave
Найти работу в IT