人工知能による推論の時代は、医療研究を加速させるリアルタイムデータ分析や、同時に何千件もの顧客からの問い合わせを解決するアシスタントといったアプリケーションを可能にしている。これらのサービスの基盤には、常時稼働するインテリジェンスと、IoTおよび消費者向けデバイスのスマートエンドポイントを支えるインフラがある。遅延、ボトルネック、エネルギーの浪費は、人々に及ぶ結果や事業コストに影響を与える。
推論ワークロードが継続的に稼働し、地理的に分散し、応答時間に敏感であることから、性能、メモリ帯域幅、ストレージ転送速度、ネットワークを一体として設計する必要がある。Tirias Researchの創設者兼主任アナリストであるJim McGregor氏によれば、人工知能は単一のワークロードではなく、何千、何百万、何十億もの異なるワークロードで構成されている。最適化は、処理能力だけでなく、メモリ、ストレージ、ネットワークの連携にも依存する。
古いインフラに最新の人工知能システムを追加するだけでは不十分であり、スケーラブルで、堅牢かつ効率的なアーキテクチャが必要となる。メモリとストレージはシステムの中心に位置し、データパイプラインはデータを取り込み、クリーンアップし、変換し、保存し、移送し、提供しなければならない。組織は、性能をコスト、柔軟性、スケーラビリティ、ワット当たりの効率、環境フットプリント、将来への備えとのバランスで捉え、成長を制限することなくボトルネックを解消しなければならない。
用語:推論
推論とは、訓練済みモデルが新しい入力に対する応答を生成することであり、訓練とは異なり、利用するたびに新たなコストが発生する。