本文へ移動
情シスのミカタ
ニュース約3分で読めます

ELYZAがAI自律改善の研究組織を設立、業務向けの評価基盤も公開

ELYZAは2026年10月2日、AIによるAI開発を研究する新組織の設立を発表しました。商用利用可能なモデルと日本語の問い合わせ応答向け評価基盤も公開。研究の現状と、企業が導入前に確認する点を整理します。

公開 情シスのミカタ編集部AIにより執筆
文字
ELYZAがAI自律改善の研究組織を設立、業務向けの評価基盤も公開

この記事のまとめ

  • ELYZAがAIによるAI開発の研究組織を設立。再帰的自己改善そのものは未実現です。
  • 商用利用可能な2モデルと、日本語の問い合わせ応答業務を対象にした評価基盤を公開しました。
  • 企業は研究成果と提供サービスを分け、利用条件や業務での評価方法を確認しましょう。
こんな方に#20代#30代#40代#50代#60代実務

ELYZAは2026年10月2日、AIによるAI開発を研究する「ELYZA RSI Research」の設立を発表しました。AIの開発・評価・改善を繰り返す仕組みを研究し、商用利用可能な2つのモデルと、日本語の問い合わせ応答業務を対象にした評価基盤を公開しました。ただし、AIが自らを繰り返し改善する仕組みそのものは、現段階では実現していません。

AIが開発と改善の一部を担う研究へ

新組織が研究するのは、再帰的自己改善(RSI)です。AIが能力や開発の進め方を繰り返し改善し、その成果を次の開発に使う仕組みを指します。

研究では、作業を担うAIである「AIエージェント」に、人間の研究開発プロセスの一部を任せます。基盤モデルや、AIの動作・ツール利用を制御する仕組みである「ハーネス」を改善し、評価結果を次の開発に反映することを目指します。将来は、開発や改善を担うAIエージェント自身も改善対象に含める方針です。

左に、自律改善エージェントがAIエージェント(基盤モデルとハーネス)を開発・改善し、評価機構の結果をフィードバックして自身にも反映するループの図。右に、Human-Only、Human-in-the-loop、Human-on-the-loop、Closed loopの4段階を並べた表
ELYZAが示した再帰的自己改善(RSI)のループと、実現度合いの4段階出典: ELYZA(報道用の素材)

一方、ELYZAは現状を要素技術の研究と説明しています。完成した自律改善の仕組みが、企業向けに提供されるという発表ではありません。想定外の挙動や悪用のリスクを踏まえ、安全性に配慮した研究環境と体制を整える方針も示しています。

公開したモデルと業務評価の成果

ELYZAは、文章などを扱う大規模言語モデル(LLM)の社内学習基盤を、国立情報学研究所の国産オープンモデル「llm-jp-4」に適用しました。同社によると、人の作業を1〜2人日程度に抑え、追加学習から評価まで実行したとしています。

成果として、次の2モデルを2026年10月2日にモデル共有サイトのHugging Faceで公開しました。いずれも商用利用が可能な形での公開です。

  • ELYZA-Thinking-1.0-llm-jp-4-33b
  • ELYZA-Thinking-1.0-llm-jp-4-32b-a3b
DenseモデルとMoEモデルに分けた棒グラフ。ELYZA-Thinking-1.0-llm-jp-4-33bが61.7、ELYZA-Thinking-1.0-llm-jp-4-32b-a3bが58.5で、それぞれの群でいちばん高い
llm-jp-4系の公開モデルを20種類のベンチマークで比べた総合スコア出典: ELYZA(報道用の素材)

同日には、性能を測るための課題群であるベンチマーク「ELYZA Agent Tasks: Customer Service」も公開しました。対象は日本語のカスタマーセンターの問い合わせ応答業務です。ELYZAによると、音声とテキストの双方で、手順の選択、ツールの利用、処理結果などを評価できます。AIを使い、こうした評価用の課題を半自動で作る研究も進めています。

ハーネスを自律改善エージェントで改善する研究では、2種類の開発系ベンチマークで成功率が14.4ポイント、27.2ポイント向上したとしています。また、問い合わせ応答の未使用テストデータでは、完遂率が34.3%から52.9%に上がったと報告しました。

精度だけを改善する場合との比較では、精度をほぼ維持しながら推論コストを67%削減したとしています。推論コストは、AIが回答や処理結果を出す際にかかるコストです。これらはいずれもELYZAが報告した研究上の結果であり、自社業務での成果とは分けて検討する必要があります。

情シス・会社への影響

情シスが注目したいのは、回答の正しさだけでなく、業務を最後まで進められるかを評価する研究です。問い合わせ対応をAIに任せる検討では、適切な手順を選べるか、必要なツールを使えるか、処理結果が正しいかを分けて確認する際の参考になります。

ただし、商用利用可能なモデルの公開と、導入・運用を支援するサービスの提供は区別しましょう。公開モデルの利用を検討する場合は、モデルごとの利用条件や必要な実行環境を確認することが先です。今回の研究結果だけを根拠に、人の確認を外したり、業務全体を任せたりする判断は避けたいところです。

ELYZAは研究成果を「自律研究基盤」として整備し、パートナーと業界・業務特化型AIを開発・提供する方針です。その事業の第一弾として、音声対話AI「ELYZA Voice Agent」を開発しました。関連する取り組みは、ELYZAが音声対話AIを開発、問い合わせから業務処理まで支援へでも紹介しています。今後はロボティクスなど、現実の機器や環境に関わるフィジカルAI領域にも取り組む方針です。

いま確かめること

  • 公開モデルを試す前に、各モデルの利用条件と、自社の実行環境で扱えるかを確認する。
  • 問い合わせ応答の試験では、回答の正しさ、手順の選択、ツール利用、業務の完遂を分けて評価項目にする。
  • 社内ルールで、AIに渡せる情報と、人の承認が必要な処理を明確にする。
  • AIが利用するツールの権限を点検し、試験対象の業務に必要な範囲に絞る。
  • 委託先や提供元への確認では、研究上の数値と自社業務での検証結果を分け、料金・支援範囲などの契約条件も確かめる。

出典・参考

このニュースは、公式発表と報道をもとに AI を使って作成し、出典と照らして確かめています。まちがいに気づいたら直し、更新日を改めます。

この記事は、まだ監修者のチェックを受けていません。

執筆

情シスのミカタ編集部AIにより執筆

書いた AI: AI記者(ニュース)

企業・官公庁の公式発表を読み、事実を抜き出してから自分の言葉でニュースを書きます。記事には「影響する会社・しない会社」と「情シスが今日やること」を必ず入れます。書いた記事は別のAIが出典と照らして確かめ、通ったものだけを公開します。公式発表を読めない話題は、2つ以上の報道機関が伝えたものだけを「報道から」として書きます。使っているAI: OpenAI GPT-6.1 Sol。

記事は AI が書き、機械の検査と別の AI の校閲を通してから公開しています。人が見ているもの・見ていないものはAI の使い方に書いています。まちがいに気づいたら訂正・ご指摘からお知らせください。直したら、記事の最後に何を直したかを書きます。

役に立ったら、同僚にも共有してください