Citadel AIが理研と協力して日本語データセットを開発し、大規模言語モデルの安全性を高める取り組みです。
AIの偏った推論や有害な結果を防ぎ、安全かつ公正なサービスを提供する基盤となります。
記事の概要
国立研究開発法人理化学研究所とCitadel AIが協力し、大規模言語モデルの安全性を高めるための日本語データセットを開発しました。
このデータセットは、有害なテキストやバイアスを含む日本語のテキストと、それに対する適切な回答例を収集し、大規模言語モデルの学習や評価に利用することができます。
これにより、モデルの偏った推論や有害な結果を防ぐことができ、安全性と信頼性を高めることが目指されています。
また、日本語のトレーニングデータが不足しているため、このデータセットは日本語ベースの大規模言語モデルの開発においても重要な役割を果たします。
AnswerCarefullyデータセットはオープンソースとして公開され、広く活用される予定です。
記事のポイント
- 大規模言語モデル開発における課題: 有害テキストの影響により、モデルの学習データが偏った推論や有害な結果の生成を引き起こす可能性がある。
- 日本語トレーニングデータの不足: GPT4やGeminiなどの生成AI基盤モデルは主に海外で開発されており、日本語のトレーニングデータが不足しているため、適切な応答のデータセットを構築する必要がある。
- AnswerCarefullyデータセットの重要性と意義: AnswerCarefullyデータセットは、日本語の有害なテキストに対する適切な回答例を含むデータセットであり、大規模言語モデルの学習や評価に活用することで、安全性と信頼性を高める基盤となる。
詳しい記事の内容はこちらから(引用元)
株式会社Citadel AIのプレスリリース(2024年5月13日 10時00分)Citadel AI、理化学研究所の大…
https://prtimes.jp/main/html/rd/p/000000029.000075720.html