Skild AI заявила, что в ходе новой демонстрации своего гуманоидного робота, играющего в футбол, обучала модель не путем программирования каждого движения по отдельности, а заставляя ее играть матчи с собственными версиями в NVIDIA Isaac Sim. Главной целью примерно 140-летнего симулированного игрового процесса было забить гол; такие навыки, как ведение мяча, перекрытие пути сопернику и подъем после падения, развивались в соответствии с этой целью. Это не означает, что робот тренировался в реальном мире в течение 140 лет.
Одной из ключевых особенностей демонстрации стал перенос поведения, усвоенного в симуляции, на физического робота. Компания заявила, что не задавала отдельные награды за удержание мяча и отбор, а эти стратегии возникли потому, что повышали вероятность забить гол. При этом независимых измерений того, как изменится результативность на реальном поле при других покрытиях, мячах, соперниках и условиях контакта, не существует.
Почему это важно
Этот подход выдвигает на первый план идею о том, что в робототехническом программном обеспечении поведение может формироваться вокруг более общей цели, а не за счет предварительного определения каждого движения. Поэтому развитие в этой области ставит вопрос о том, как следует проектировать обучение в симуляции, особенно для исследователей, занимающихся принятием решений гуманоидными роботами в сложных и изменчивых условиях. Возможность переноса усвоенного поведения на физического робота также показывает, что разрыв между симуляцией и реальным миром — это не просто техническая деталь: изменения покрытия, мяча и контакта с соперником могут влиять на результаты. Главный открытый вопрос заключается в том, в какой степени навыки, продемонстрированные в ходе показа, сохранятся при различных условиях реального поля и как этот перенос будет подтверждаться независимыми измерениями.