Snorkel AI, стартап, разрабатывающий наборы данных для обучения и симулированные среды для лабораторий ИИ и компаний, привлёк $350 миллионов в раунде Серии E под руководством Insight Partners и S32. Оценка семилетней компании выросла до $3.5B — примерно втрое по сравнению с уровнем в $1.3B, достигнутым 17 месяцев назад в раунде Серии D. В раунде также приняли участие Addition, Lightspeed, Greylock, GV и Wells Fargo.
Изначально Snorkel предлагала программное обеспечение для автоматизации разметки данных, однако в прошлом году компания переключилась на готовые наборы данных, которые называет «data-as-a-service». Компания объединяет профильных экспертов с программным обеспечением и моделями в рамках гибридного подхода, включающего генерацию синтетических данных. Snorkel сообщает, что её годовая выручка за последние 12 месяцев выросла в восемнадцать раз и достигла $375 миллионов, связывая этот рост со спросом лабораторий ИИ на продвинутые данные для обучения.
Сообщается, что годовая валовая выручка аналогичных компаний составляет:
- Mercor: $2 миллиарда
- Handshake: $1 миллиард
- Micro1: $500 миллионов
Поскольку эти компании выплачивают примерно от 60% до 70% своей выручки экспертам, выполняющим работу, их чистая годовая выручка значительно ниже указанных валовых показателей. Snorkel же заявляет, что продаёт среды для обучения с подкреплением (RL) и готовые наборы данных вместо человеческого труда, а выплаты экспертам учитываются в себестоимости проданных товаров, а не в выручке.
Компания начала коммерческую деятельность в 2019 году после четырёх лет исследований Alex Ratner и команды Stanford AI lab.
Почему это важно
Перенос Snorkel своей бизнес-модели от автоматизации разметки к готовым наборам данных и смоделированным средам показывает, что команды, разрабатывающие искусственный интеллект, ищут не только необработанные данные, но и непосредственно применимую учебную инфраструктуру, содержащую экспертные знания. Гибридная структура, объединяющая вклад предметных экспертов с программным обеспечением, моделями и генерацией синтетических данных, указывает на то, как процесс подготовки данных превращается в коммерческий продукт. Однако доходы компаний в этом секторе формируются по-разному: некоторые показывают выплаты экспертам в составе валовой выручки, тогда как Snorkel относит их к себестоимости проданных товаров; поэтому заявленные показатели нельзя напрямую сопоставлять. Открытым остаётся вопрос о том, как эта модель будет одновременно удовлетворять растущий спрос на продвинутые данные и сохранять рост выручки и качество данных, а также каким образом структура затрат на услуги по работе с данными будет стандартизирована в отрасли.