ELYZAは2026年10月2日、AIによるAI開発を研究する「ELYZA RSI Research」の設立を発表しました。AIの開発・評価・改善を繰り返す仕組みを研究し、商用利用可能な2つのモデルと、日本語の問い合わせ応答業務を対象にした評価基盤を公開しました。ただし、AIが自らを繰り返し改善する仕組みそのものは、現段階では実現していません。
AIが開発と改善の一部を担う研究へ
新組織が研究するのは、再帰的自己改善(RSI)です。AIが能力や開発の進め方を繰り返し改善し、その成果を次の開発に使う仕組みを指します。
研究では、作業を担うAIである「AIエージェント」に、人間の研究開発プロセスの一部を任せます。基盤モデルや、AIの動作・ツール利用を制御する仕組みである「ハーネス」を改善し、評価結果を次の開発に反映することを目指します。将来は、開発や改善を担うAIエージェント自身も改善対象に含める方針です。
ELYZAが示した再帰的自己改善(RSI)のループと、実現度合いの4段階出典: ELYZA(報道用の素材)
一方、ELYZAは現状を要素技術の研究と説明しています。完成した自律改善の仕組みが、企業向けに提供されるという発表ではありません。想定外の挙動や悪用のリスクを踏まえ、安全性に配慮した研究環境と体制を整える方針も示しています。
公開したモデルと業務評価の成果
ELYZAは、文章などを扱う大規模言語モデル(LLM)の社内学習基盤を、国立情報学研究所の国産オープンモデル「llm-jp-4」に適用しました。同社によると、人の作業を1〜2人日程度に抑え、追加学習から評価まで実行したとしています。
成果として、次の2モデルを2026年10月2日にモデル共有サイトのHugging Faceで公開しました。いずれも商用利用が可能な形での公開です。
- ELYZA-Thinking-1.0-llm-jp-4-33b
- ELYZA-Thinking-1.0-llm-jp-4-32b-a3b
llm-jp-4系の公開モデルを20種類のベンチマークで比べた総合スコア出典: ELYZA(報道用の素材)
同日には、性能を測るための課題群であるベンチマーク「ELYZA Agent Tasks: Customer Service」も公開しました。対象は日本語のカスタマーセンターの問い合わせ応答業務です。ELYZAによると、音声とテキストの双方で、手順の選択、ツールの利用、処理結果などを評価できます。AIを使い、こうした評価用の課題を半自動で作る研究も進めています。
ハーネスを自律改善エージェントで改善する研究では、2種類の開発系ベンチマークで成功率が14.4ポイント、27.2ポイント向上したとしています。また、問い合わせ応答の未使用テストデータでは、完遂率が34.3%から52.9%に上がったと報告しました。
精度だけを改善する場合との比較では、精度をほぼ維持しながら推論コストを67%削減したとしています。推論コストは、AIが回答や処理結果を出す際にかかるコストです。これらはいずれもELYZAが報告した研究上の結果であり、自社業務での成果とは分けて検討する必要があります。
情シス・会社への影響
情シスが注目したいのは、回答の正しさだけでなく、業務を最後まで進められるかを評価する研究です。問い合わせ対応をAIに任せる検討では、適切な手順を選べるか、必要なツールを使えるか、処理結果が正しいかを分けて確認する際の参考になります。
ただし、商用利用可能なモデルの公開と、導入・運用を支援するサービスの提供は区別しましょう。公開モデルの利用を検討する場合は、モデルごとの利用条件や必要な実行環境を確認することが先です。今回の研究結果だけを根拠に、人の確認を外したり、業務全体を任せたりする判断は避けたいところです。
ELYZAは研究成果を「自律研究基盤」として整備し、パートナーと業界・業務特化型AIを開発・提供する方針です。その事業の第一弾として、音声対話AI「ELYZA Voice Agent」を開発しました。関連する取り組みは、ELYZAが音声対話AIを開発、問い合わせから業務処理まで支援へでも紹介しています。今後はロボティクスなど、現実の機器や環境に関わるフィジカルAI領域にも取り組む方針です。
いま確かめること
- 公開モデルを試す前に、各モデルの利用条件と、自社の実行環境で扱えるかを確認する。
- 問い合わせ応答の試験では、回答の正しさ、手順の選択、ツール利用、業務の完遂を分けて評価項目にする。
- 社内ルールで、AIに渡せる情報と、人の承認が必要な処理を明確にする。
- AIが利用するツールの権限を点検し、試験対象の業務に必要な範囲に絞る。
- 委託先や提供元への確認では、研究上の数値と自社業務での検証結果を分け、料金・支援範囲などの契約条件も確かめる。