RedditデータがなければLLMは「存在しない」
Reddit CEOのSteve Huffman氏は、Redditのコンテンツがなければ大規模な言語モデルは「我々が知っているように存在しなかった」と語った。同氏は、このプラットフォームのユーザー生成データをAIにとっての「現代の石油」と呼んだ。
ハフマン氏は、ファスト・カンパニーの最も革新的な企業サミットでのインタビューでコメントした。
AIにとってのRedditの価値についてハフマン氏が語ったもの
ハフマン氏は、AIエコシステムにおけるRedditのデータの位置づけについて説明した。
ハフマン氏はこう語った。
「Reddit がなければ、我々が知っている LLM は存在しなかったでしょう。Reddit は LLM のトレーニング データの単一最大のソースの 1 つであり、Reddit は引き続き両方のトレーニング データの主要なソースの 1 つであり、当社はすべてのモデルにわたって最も引用され、最も引用されるプラットフォームでもあります。」
同氏は、引用の主張は AI 引用データを追跡する会社 Profound によるものだと主張した。
ハフマン氏は、AI企業がコンテンツに依存する理由を説明した。
「実際の知能がなければ、人工知能は存在しません。結局のところ、これらのモデルは非常に単純です。これらのモデルは、他の場所で消費したものを絶対に大規模に吐き戻しており、その消費の大部分は実際には Reddit 上の人間の会話にすぎません。なぜならそれは自然であり、基本的に考えられるすべてのトピックをカバーしているからです。」
一部の人にとっては取引、他の人にとっては訴訟
Redditは、2024年にGoogleおよびOpenAIとのデータライセンス契約を発表した。ハフマン氏は、これらをRedditのオリジナルの2つのAIデータ契約と言及し、追加の契約については発表しなかった。
「GoogleとOpenAIと最初の2つの取引を行って以来、それは2年以上前のことなので、私たちは多くのことを学びました。彼らは多くのことを学びました。全世界が多くのことを学びました。具体的には、Redditのデータがどれほど価値があり、それがどれほど有用であるかということです。そのため、私たちはそこで非常に慎重かつ選択的に取り組んでいると思います。しかし、ええ、私たちはオープンでビジネスにオープンです。」
ライセンス条項に同意していない企業に対して、レディットは法的措置を講じた。同社はRedditコンテンツの不正使用とRedditの規約違反を主張して、カリフォルニア州上級裁判所にAnthropicを訴えた。 Redditは、DMCA回避防止違反とそれに関連する申し立てを主張して、データスクレイピング会社3社とともに、ニューヨーク州南部地区のPerplexityに対して連邦訴訟を起こした。
ハフマンは2つのグループの間に線を引いた。
「Google や OpenAI のような企業とは、私たちが良好な関係を築いていたため、実際に取引を行って、使用にいくつかのガードレールを設置し、ユーザーに代わってデータにアクセスすることができますが、その後、次世代のインターネット向け製品の開発で協力することができます。」
同氏は、「すべての企業が協力パートナーになることに積極的ではないため、残念ながら訴訟という別の道を歩まざるを得ません。」と付け加えた。
ハフマン氏は聴衆に対し、商用利用に対するレディットの立場は単純だと語った。 「当社のデータを商業利用するには商業条件が必要です」と彼は言いました。 Reddit は 2023 年に商用 API アクセスの課金を開始しましたが、これは現在のライセンス契約に先立つ動きです。
ハフマン氏は、レディットは現在も研究者や大学に無料のデータアクセスを提供しており、非営利利用については柔軟性を維持しようとしていると述べた。
Redditのオープンさを変えたもの
ハフマン氏によると、AI業界がオープンリサーチから遠ざかると、データを自由に共有するレディットの姿勢が変化したという。 SEJが以前に報じたように、Redditは多くの検索エンジンクローラーのアクセスを制限したが、Googleは例外のままだった。
「歴史的に、Reddit はオープンなインターネットから生まれたようなもので、Reddit はオープンであり、そのデータへのアクセスには非常に寛容でした。そして正直に言って、もし AI 企業が依然として基本的にオープンでオープンソースであり、オープンな研究を行っていたら、今日私たちは違った立場にあっただろうと思います。」
ハフマン氏は、問題はレディットがデータがどのように使われているかを追跡できなくなったことだと述べた。 「人々は私たちのデータを使用していますが、それが何に使用されていたのかはわかりません」と彼は聴衆に語った。
ハフマン氏は、レディットは商業的条件を超えて、そのデータがユーザーを特定したり、ユーザーを広告でターゲットにしたり、プラットフォームを置き換えたり仲介を排除したりするために使用されることを防ぎたいと述べた。
Reddit 独自の AI への取り組み
ハフマン氏は、彼の言うところの「パラドックス」を認めた。 Reddit のコンテンツは外部 AI システムを強化していますが、同社はプラットフォーム全体で AI も使用しています。
最も注目されている製品は、LLM を利用した検索機能である Reddit Answers です。投稿とコメントを読み取り、ユーザーの逐語的な引用から構築された応答に整理します。ハフマン氏は、これは最終的な答えのない質問のために設計されていると指摘した。
「Reddit Answers が行っていることは、Reddit に特有のことがいくつかあります。1 つは、基本的に実際の人々からの逐語的な引用でのみ回答することです。そして 2 つ目は、複数の視点を提示しようとすることです。なぜなら、Reddit を利用している場合、肝心なのは人間の視点が必要だからです。」
Reddit は舞台裏で AI を使用してコンテンツの管理と分類を行っています。 LLM は、コメントがいじめに該当するかどうかを評価できますが、ハフマン氏はこれまで、主観が含まれるため難しいと述べていました。
ハフマン氏は、AI モデレーションを、Reddit のコミュニティ モデレーション モデルの代替としてではなく、最悪のコンテンツへの露出を減らす方法として紹介しました。
「インターネット上で最悪の仕事は、インターネット上の最悪のコンテンツを調べて、それをオンラインにできるかどうかを判断することでした」とハフマン氏は語った。 「その仕事はすぐになくなってしまいます。」
AI が書いた投稿のグレーゾーン
ハフマン氏はまた、ユーザーがAIツールを使ってコンテンツを作成し、それをRedditに貼り付けるという課題にも言及した。それは自動化されたボット活動とは異なる、と同氏は強調した。
「Reddit だけでなく、インターネット全体で見かける最も迷惑なのは、ChatGPT で投稿やコメントを書いて Reddit に貼り付けた人です。たとえば、あれはボットですか? 確かにボットのように感じますが、そのアイデアの背後には人間がいます。」
ハフマン氏はこの問題を意図の一つとして指摘した。 「アイデアの背後、コンテンツの背後、プロンプトの背後に人間がいることは、私たちにとって非常に重要です」とハフマン氏は語った。しかし同氏は、ユーザーがAIに依存して投稿を作成すると「文章が最悪になる」とも指摘した。
ハフマン氏は、この問題に対処するポリシーを作成するのではなく、レディットのコミュニティにこの問題を処理させるつもりだと示唆した。ユーザーはすでにAIが書いたコンテンツに反対票を投じ、コメントで批判している。ハフマン氏は、レディットが「ユーザーとサブレディットがその種のコンテンツを完全に拒否できるようにするだろう」と語った。
彼はこの広範な質問を数学の授業での電卓に例えました。 「最近の子供たちは、AI を使って文章を書く方法を学んでいるところです。私たちはそれについて何をするつもりでしょうか?」彼は言いました。 「私たちは他のみんなと一緒に学ばなければいけないと思います。」
なぜこれが重要なのか
ハフマン氏のコメントは、ユーザーによるディスカッションが AI システムの中核となるインプットであるという Reddit の主張を強化するものである。
ハフマン氏が説明した AI が作成したコンテンツの問題は、広範な YouTube AI スロップ調査の一環として SEJ がカバーした 1 つです。検出ツールを構築するのではなく、コミュニティ投票で AI 生成の投稿を処理できるようにするという Reddit の決定は、自動ラベル付けを導入したプラットフォームとは異なる道です。
将来を見据えて
ハフマン氏はファスト・カンパニーに対し、レディットは新たなデータ取引について「常に市場で人々と話し合っている」と語ったが、3回目の合意については示唆しなかった。
AnthropicとPerplexityに対するRedditの訴訟はどちらも進行中である。このアントロピック事件は、3月に連邦裁判所の差し戻し審理の対象となった。
