Snorkel AIは、AIラボや企業向けにトレーニングデータセットとシミュレーション環境を開発するスタートアップで、Insight PartnersとS32が主導したSeri Eラウンドで$350ミリオンの資金を調達した。設立から7年の同社の評価額は$3.5Bに上昇し、17カ月前のSeri Dラウンドで到達した$1.3Bの水準から約3倍になった。今回のラウンドにはAddition、Lightspeed、Greylock、GV、Wells Fargoも参加した。
Snorkelは当初、データラベリングの自動化ソフトウェアを提供していたが、昨年から同社が「data-as-a-service」と呼ぶ完成済みデータセットに軸足を移した。同社は、合成データの生成も含むハイブリッドなアプローチで、分野の専門家をソフトウェアやモデルと組み合わせている。年率換算の売上高が過去12カ月で十八倍に増え、$375ミリオンに達したとSnorkelは説明しており、この成長をAIラボによる高度なトレーニングデータへの需要に結び付けている。
同様の企業について、総年率換算売上高は次のように報告されている。
- Mercor: $2ビリオン
- Handshake: $1ビリオン
- Micro1: $500ミリオン
これらの企業は売上高の約60~70%を業務を担う専門家に支払っているため、純年率換算売上高はこれらの総額を大幅に下回る。これに対してSnorkelは、人手ではなく強化学習(RL)環境と完成済みデータセットを販売しており、専門家への支払いは売上高ではなく売上原価として計上されると説明している。
同社は、Alex RatnerとStanford AI labチームによる4年間の研究を経て、2019年に商業事業を開始した。
なぜ重要か
Snorkelがビジネスモデルの軸足をデータラベリングの自動化から完成済みデータセットとシミュレートされた環境へ移したことは、AIを開発するチームが単なる生データではなく、すぐに利用でき、専門知識を備えたトレーニング基盤を求めていることを示している。ハイブリッドな構造は、分野の専門家による貢献をソフトウェア、モデル、合成データの生成と組み合わせることで、データ準備のプロセスがどのように商業化されているかを示している。しかし、業界の企業は同じ形で収益を計上しているわけではない。一部の企業は専門家への支払いを売上高に総額で計上する一方、Snorkelはこれらを売上原価として計上しているため、開示された数字を直接比較することはできない。残る明確な問いは、このモデルが高度なデータ需要に応えながら、収益の成長とデータ品質をどのように維持するのか、さらにデータサービスのコスト構造が業界でどのように標準化されるのかという点である。