[AIツール利用者向け]MicrosoftのAI画像生成モデル「MAI-Image-2」—フォトリアリズムと文字生成を強化し世界トップ3入り

目次

はじめに

 MicrosoftのAIチーム(MSI team)が2026年3月19日、AI画像生成モデル「MAI-Image-2」を発表しました。Arena.aiのテキスト画像変換リーダーボードでモデルファミリー3位を記録した本モデルは、フォトリアリズムと画像内テキスト生成を中心に強化されています。本稿では、公式発表と第三者レビューをもとに、機能・提供状況・現時点での制約を解説します。

参考記事

要点

  • MicrosoftのAIチームが発表した「MAI-Image-2」は、Arena.aiテキスト画像変換リーダーボードでモデルファミリー3位を記録した(前モデルのMAI-Image-1は9位)
  • フォトリアリズム、画像内テキスト生成の安定性、複雑なシーン描写の3点を中心に強化されている
  • MAI Playgroundで即日試用可能で、CopilotおよびBing Image Creatorへのロールアウトも始まっている
  • APIアクセスは広告グループWPPなど一部法人に先行提供されており、近くMicrosoft Foundryで一般開発者にも公開予定である
  • 現状は正方形(1:1)出力のみ対応で、image-to-imageや各種編集機能は未実装である

詳細解説

MAI-Image-2の概要と位置づけ

 MAI-Image-2は、MicrosoftのAIチーム(MSI team)が開発したテキストから画像を生成するAIモデルです。Microsoftによれば、写真家、デザイナー、ビジュアルストーリーテラーへのヒアリングをもとに設計されており、日常的なクリエイティブ作業での実用性を重視して開発されました。前モデルのMAI-Image-1は2025年10月に発表されており、今回はおよそ5ヶ月ぶりのアップデートとなります。

 Arena.aiは複数のAI画像生成モデルを比較評価するコミュニティベースのリーダーボードです。Microsoftの発表によれば、MAI-Image-2のモデルファミリーはこのランキングで3位にランクインしています。Thurrott.comの報道によれば、現在の1位はGoogle Gemini 3.1 Flash、2位はOpenAI GPT-Image 1.5とされており、MicrosoftはGoogleとOpenAIに次ぐ位置に入ったことになります。前モデルMAI-Image-1がリリース時点で9位だったことを踏まえると、大幅な順位向上と言えます。

強化された3つの機能

フォトリアリズムの向上

 Microsoftの発表によれば、MAI-Image-2は自然な光の表現、正確な肌色の再現、生活感のある環境描写を特徴としており、生成画像が実在するかのような質感を目指して設計されています。クリエイターが後処理での修正に費やす時間を減らし、制作そのものに集中できることを目的としています。AI画像生成では均一すぎる照明や不自然な肌色が従来から指摘されてきた課題であり、この点での改善は実務利用においても意義があると考えられます。

画像内テキスト生成の信頼性

 ポスターや看板など、テキストを含む画像の生成は多くのAI画像モデルが苦手とする領域です。MAI-Image-2はインフォグラフィック、スライド、図表といったテキストを含むコンテンツを安定して生成できるとMicrosoftは説明しています。Decryptのハンズオンテストによれば、Arena.aiのリーダーボードでは上位に位置するOpenAI GPT-Imageと比較しても、画像品質とテキストレンダリングの両面で優れた結果が確認されたとのことです。リーダーボードの順位と実際の品質が必ずしも一致しない可能性を示す興味深い結果と言えます。

複雑なシーン描写への対応

 シュールなコンセプト、緻密な構図、壮大な世界観といった複雑なビジュアル表現にも対応しています。Microsoftによれば、タイポグラフィのレイアウトやポスターについても、スタイル、画像、フォント、カラーなどを細かく指示して生成できるとのことです。

提供状況とアクセス方法

 MAI-Image-2はMAI Playground(playground.microsoft.ai/chat)で現在試用可能です。また、CopilotおよびBing Image Creatorへのロールアウトが始まっています。APIアクセスについてはWPPなど一部の法人顧客向けに先行提供されており、Microsoft Foundry経由での一般開発者向け公開も近く予定されています。商用利用を検討する場合は、Microsoftが公開している申込フォームから問い合わせができます。

 なお、Winbuzzerの報道によれば、MSI team CEOのMustafa Suleiman氏はXへの投稿で本モデルを紹介するとともに、チームが最新のGB200コンピュートクラスタ(NVIDIAのBlackwellアーキテクチャ採用)を稼働させたことも明らかにしています。専用の計算基盤が整ったことで、次世代モデルの開発サイクルが加速する可能性があると考えられます。

現時点での制約

 複数の第三者レビューが指摘している点として、現状のMAI-Image-2にはいくつかの制約があります。Winbuzzer、Decrypt、Windows Centralによれば、出力できる解像度は正方形(1:1)のみで、横向き・縦向き・任意のアスペクト比には現時点で対応していません。ソーシャルメディアでは縦型や横長のフォーマットが多く使われるため、コンテンツ制作の用途によっては制約になる場面があると思います。

 また、1回の生成後に30秒のクールダウンが発生し、1日あたりの生成枚数にも上限が設けられています。さらに、画像から画像を生成するimage-to-image機能、一部を修正するインペインティング、画像を拡張するアウトペインティングといった編集機能は未実装で、現状はテキストから画像を生成する機能に特化したツールとなっています。MidjourneyやAdobe Fireflyなど競合ツールが既に提供しているこれらの機能への対応時期は公表されていません。

まとめ

 MicrosoftのMAI-Image-2は、フォトリアリズムと画像内テキスト生成を強みとするAI画像モデルとして登場し、Arena.aiでの3位という評価は一定の品質水準を示しています。一方で、アスペクト比の制限や編集機能の未実装など、実用上の制約もあります。今後の機能拡張と、競合モデルとの差がどう推移するかに注目したいところです。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次