一文による定義
機械学習は、通常、新しい入力に適用できるパターンを見つけることによって、タスクのパフォーマンスを向上させるためにデータから学ぶシステムを構築する方法です。
クイックアンサー
機械学習は現代のAIシステムを構築する主要な方法の一つです。すべてのルールを手で記述する代わりに、チームはデータ、学習方法、タスク、およびパフォーマンスの測定方法を選択します。学習プロセスによりモデルが生成されます。このモデルは、新しい入力に基づいて分類、順位付け、予測、推薦、検出、グループ化、生成を行うことができます。
キーワードは「新しい」です。トレーニング例を記憶するだけのモデルはあまり役に立ちません。トレーニング中に見た例の範囲を超えて機能するパターンを学ぶことが目的です。この能力はしばしば一般化と呼ばれます。一般化が失敗すると、モデルはデモでは良いように見えるかもしれませんが、実際のユーザー、異なるデータ、または変化した状況ではパフォーマンスが低下します。
なぜ重要なのか
機械学習はすでに多くの人々が使っているツールを駆動しています。スパム検出、詐欺アラート、検索順位、製品の推薦、音声認識、画像ラベリング、ルート推定、信用リスク支援、生成AIの一部などです。これらのシステムを賢く使うには数学を知る必要はありませんが、モデルの出力がデータ、トレーニングの選択、評価、展開の文脈に依存していることを理解する必要があります。
これは機械学習が作業を速くする一方で、不確実性を隠す可能性があるため重要です。データが不完全な場合でも、モデルスコアは正確に見えるかもしれません。推奨は過去の行動によって形成されるかもしれませんが、現在の状況に合っていない可能性があります。分類器は一般的なケースでは機能するかもしれませんが、珍しいケースでは失敗する可能性があります。統計的学習の要素は、監視付き学習と非監視学習を分野の広範な部分として扱っており、これは機械学習が単一の技術ではないことを思い出させるための役に立ちます[2]。
仕組み
基本的な機械学習ワークフローはタスクから始まります。教師あり学習では、チームは入力と望ましい出力が含まれた例を収集します。これは、スパムまたは非スパムとしてラベル付けされたメッセージ、オブジェクトでラベル付けされた画像、または詐欺または通常の過去の取引をラベル付けしたものなどです。学習アルゴリズムはモデルを調整し、その出力がトレーニング例により一致するようにします。
教師なし学習は異なります。これは、単一のターゲットラベルなしでデータの構造を探します。たとえば、類似した顧客をグループ化したり、関連するドキュメントのクラスターを見つけることなどです。強化学習はまた異なります。これは、行動と結果に関するフィードバックから学習するシステムです。これらのカテゴリは役立ちますが、実際の製品は通常、いくつかの方法をルール、人間のレビュー、ソフトウェア制約とともに組み合わせます。
トレーニング後、モデルは評価する必要があります。チームは通常、トレーニングデータをテストまたは検証データから分離し、モデルがトレーニングしていない例で動作するかどうかを尋ねます。良い評価は1つの数値だけを見ていません。エラー、エッジケース、欠損データ、サブグループのパフォーマンス、そして世界が変化したときにモデルがまだ役立つかどうかを見ます。
エンドツーエンドの例
電子メールサービスがスパムフィルターを構築していると想像してください。チームは過去の多くのメッセージを収集し、スパムまたはスパムでないとしてラベル付けします。モデルはこれらの例からパターンを学びます。疑わしいリンク、繰り返しの表現、送信者の行動、フォーマット、ユーザー報告などです。新しい電子メールが届くと、モデルはスコアまたはラベルを生成します。
良い製品は、そのラベルを完璧な真実として扱いません。おそらく、おそらくスパムを別のフォルダーに配置し、ユーザーがミスを修正できるようにし、偽陽性をモニタリングし、攻撃者が戦術を変更したときに再トレーニングします。目標は、モデルに知的なように聞こえさせることではなく、新しいメッセージで良好に動作する有用な意思決定支援システムを作ることです。エラーから人々を回復させることもできます。
一般的な誤解
最大の誤解は、機械学習が自動的に真実を発見すると考えることです。機械学習は、与えられた条件下でタスクを最適化するパターンを発見します。ラベルが間違っている、データにバイアスがある、タスクが適切に定義されていない、または未来が過去と異なる場合、モデルは信頼できない結果を生成する可能性があります。
もう一つの誤解は、データが多いほど問題が解決されるということです。より関連性があり、高品質なデータは役立ちます。しかし、古い、ノイズが多い、バイアスのある、重複している、または誤ってラベル付けされたデータが多いと、システムはさらに悪化する可能性があります。モデルは、訓練に使われた例と目的によって形作られます。
リスクと制限
機械学習システムは過学習、悪い一般化、データの変化、隠れたバイアス、プライバシーの漏洩、弱い評価、明確でない所有権、悪い製品設計によって失敗することがあります。モデルは全体的にはうまく機能するかもしれませんが、小さなグループ、レアな状況、または高リスクのケースでは失敗する可能性があります。そのため、重要な決定には平均的な正確度だけでは不十分です。
NISTはAIシステムを、技術的なコンポーネントだけでなく、人間、組織、社会的な文脈からのリスクが生じる社会的技術システムとして扱っています[3]。機械学習の場合、モデルはシステムの一部に過ぎません。データ収集、ラベリング、モニタリング、ユーザーインターフェース、フィードバックループ、上訴経路、および人間の監督すべてが重要です。
実践的な判断チェックリスト
機械学習の出力を信頼する前に、次の質問をしてください。このモデルはどのタスクのためにトレーニングされましたか?どのようなデータがそのモデルを形作ったのでしょうか?出力の意味は何か?このケースのようなデータでテストされましたか?一般的なミスはどのようなものがありますか?関連するグループ全体でモデルは公平に動作しますか?トレーニング以降、世界は変わりましたか?結果をオーバーライドまたはレビューできるのは誰ですか?
機械学習の出力を自動的な真実ではなく、役立つシグナルとして使用してください。低リスクの分類や提案には、モデルは時間を節約できます。採用、融資、医療、法務、安全、セキュリティ、顧客への影響のある決定には、より強力なテスト、ドキュメンテーション、モニタリング、および人間の責任を必要とします。