Fastlyが新たに発表した「Fastly AI Accelerator」は、大規模言語モデル(LLM)の応答速度を劇的に向上させ、AIアプリの「もっさり感」を解消します。
これにより、ユーザー体験が向上し、コスト削減も実現。
AI技術の利便性を高めるこの取り組みは、企業の競争力に影響を及ぼすことが期待されます。
記事の概要
米Fastlyは、新たに「Fastly AI Accelerator」を導入し、大規模言語モデル(LLM)のレスポンス速度を向上させる攻撃を仕掛けています。
従来のLLMは反応が遅く、利用者に「もっさり感」を感じさせることが多かったですが、この新しいキャッシュ機能は、以前の質問に対する回答を保存し、再利用することで、迅速な応答を実現します。
また、LLMへの問い合わせを減らすことでAPI利用料の節約も可能です。
対応するLLMは、OpenAIやGoogleの「Gemini」などがあり、今後はMicrosoftの「Azure OpenAI Service」も追加予定です。
Fastlyは、ユーザーがアプリのソースコードを簡単に変更するだけでこの機能を利用できるように設計しており、使いやすさを重視しています。
AI Acceleratorの導入により、高頻度のクエリに対して最大75%の速度向上が期待されています。
記事のポイント
- キャッシュ機能の導入: FastlyのAI Acceleratorは、LLMからの回答をキャッシュすることで、反応速度を大幅に向上させます。
- コスト削減効果: キャッシュを活用することで、過去の質問に対するAPI利用料を節約できる点が強調されています。
- 対応モデルの拡充: FastlyはOpenAIやGoogleのモデルに加え、Microsoftのサービスにも対応予定で、顧客の選択肢を広げます。
詳しい記事の内容はこちらから(引用元)
米Fastlyが、LLMの回答速度を高めるキャッシュ「Fastly AI Accelerator」で攻勢をかけている。…
https://xtech.nikkei.com/atcl/nxt/column/18/00001/10022/