Ox Alphaベンチマーク結果:DeepSWEスコアと比較 - ベンチマーク

Ox Alphaベンチマーク結果:DeepSWEスコアと比較

報告されたDeepSWE 80%スコア、モデル比較、タスク別パフォーマンス、評価上の限界を含むOx Alphaのベンチマーク結果を確認します。

2026-08-22
Ox Alpha Wikiチーム
クイックガイド
  • Ox Alphaのベンチマーク結果:報告されたDeepSWEスコアは、10件のソフトウェアエンジニアリングタスクで**80%**に達しています。
  • 比較ポイント:この結果は、Fable 5.5、GLM 5.3、Grock 4.6 6、GPT 5.6でテストされたスコアを上回っています。
  • 最も強い分野:インタラクティブな3Dモデリング、3Dキネマティクス、機能的なフロントエンドプロトタイプが際立っています。
  • 重要な背景:これらの数値は、普遍的なモデルランキングではなく、限定的に報告されたテストに基づくものです。
  • 最適な活用法:このスコアを評価の一指標として扱い、再現可能な独自テストで出力を検証してください。

Ox Alphaベンチマーク結果の概要

現在のOx Alphaベンチマーク結果の中心となるのは、10件のタスクを含む、報告されたDeepSWE SWEコーディングテストでの80%スコアです。この数値により、同じテストに含まれる比較対象モデルよりOx Alphaが上位に位置しています。ただし、サンプル数が少ないため、あらゆるコーディング作業やモデル全般の能力を代表するものではありません。

この結果が注目を集めている理由の一つは、Ox AlphaがOpenRouterとOpenCode上でステルスモデルとして登場した一方、提供された資料には開発者に関する確認済みの公開情報がないことです。報告されたモデルプロファイルには、100万トークンのコンテキストウィンドウと、テキスト・画像・動画入力への対応が含まれています。これらの機能は、長文脈またはマルチモーダルなワークフローでの性能に影響する可能性がありますが、テスト条件外でのベンチマーク性能を証明するものと見なすべきではありません。

動画のハイライト:

  • 10件のDeepSWE SWEコーディングタスクで報告された**80%**の結果
  • 5つのモデル結果との比較
  • コーディング、3D、デザイン、物理、フルスタック作業を含むインタラクティブテスト
  • ブラウザベースの3Dおよびモーションタスクでの優れたデモンストレーション
評価指標報告された結果示唆されること
DeepSWE SWEテスト80%10件のサンプルにおける高いパフォーマンス
コンテキストウィンドウ100万トークン非常に大規模なテキストまたはコードコンテキスト向けに設計
入力モードテキスト、画像、動画マルチモーダルなインタラクションをサポート
報告された処理容量1日あたり最大100兆トークンモデル品質ではなく、利用可能な容量に関する主張
公開上の身元未確認提供された情報源ではモデルの由来が明確でない

最も安全な解釈は、Ox Alphaが特にソフトウェアエンジニアリングにおいて、有望な初期結果を示したというものです。ベンチマークスコアは、タスクの詳細、プロンプト、ツール設定、エラー処理、独立した再現テストと組み合わせた場合に最も有用です。こうした条件管理がなければ、単一のパーセンテージは決定的な結論ではなく、方向性を示す数値として見るべきです。

編集部の見解

80%という数値を調査の出発点として活用してください。注目に値する報告結果ではありますが、Ox Alphaがあらゆるコーディングタスクで、すべてのモデルを上回ることを示すものではありません。

DeepSWEスコアの比較

利用可能な比較の中で最も明確なのは、同じ報告テストに含まれる他のモデルとOx Alphaの差です。Ox Alphaは**80%**を記録した一方、Fable 5.5は65%、GLM 5.3は62%、Grock 4.6 6は62%、GPT 5.6は52%でした。

これらの数値は慎重に比較する必要があります。提供された資料には、完全なプロンプトセット、採点基準、温度設定、ツールへのアクセス、モデルのバージョン、すべてのシステムが同一設定を使用したかどうかが記載されていません。そのため、以下の表では報告された数値を記録していますが、統制されたリーグ表として提示しているわけではありません。

モデル報告スコアOx Alphaとの差解釈
Ox Alpha80%このテストで報告された最高結果
Fable 5.565%15パーセントポイント掲載結果の中で2位
GLM 5.362%18パーセントポイント中位の比較結果
Grock 4.6 662%18パーセントポイント報告上はGLM 5.3と同率
GPT 5.652%28パーセントポイント掲載結果の中で最低

報告された順位は、追加テストを行う価値のあるシステムを特定するうえで役立ちます。一方で、推論能力、信頼性、レイテンシ、本番運用への適性について広範な主張を行うには不十分です。特定のソフトウェアエンジニアリングサブセットで高い性能を示すモデルでも、セキュリティ、保守性、ドキュメント、エッジケースについては綿密な確認が必要になる場合があります。

DeepSWEサブセットにおけるOx Alphaの80%以上のスコアは、2026年8月21日に公開されたAGTP Insights on Xでも言及されています。この投稿は見出しとなる結果を裏付ける参考情報として有用ですが、利用可能なページ内容には完全な方法論や詳細なスコア内訳は掲載されていません。

注目の結果

**80%**が報告された主要スコアであり、Ox Alphaが注目を集めている最大の理由です。

相対的なリード

報告された差は、Fable 5.5に対して15ポイント、GPT 5.6に対して28ポイントです。

評価上の注意

サンプルは10件のタスクで構成されているため、一般的な結論を出すには、より広範なテストが必要です。

ベンチマークに関する警告

これらのパーセンテージを、無関係なベンチマークの結果と組み合わせないでください。データセット、採点者、プロンプト、ツール権限が異なると、結果は大きく変わる可能性があります。

タスク別のパフォーマンス指標

より広範な評価では、コーディングのパーセンテージ以外にも多くの結果が示されています。Ox Alphaは、ベクターイラスト、3Dモデリング、3Dキネマティクス、フロントエンドデザイン、ゲーム物理、フルスタックアプリケーションでテストされました。これは従来型のゲームではなくAIモデルに関する評価であるため、これらの例は能力のデモンストレーションとして理解するのが適切です。

特に強い印象を与えるのは、生成とインタラクションを組み合わせたタスクです。3Dピルオーガナイザーには、ラベル付きの7つのコンパートメント、個別に開く蓋、錠剤、影、すべて開く・すべて閉じる操作が含まれていました。シザーリフトには、プラットフォームの高さを変更しながら、機構のアーム同士の連動した動きを維持するスライダーが備わっていました。

テストカテゴリ実演された出力報告された品質指標
ベクターイラストSVG形式のアライグマとキツネのイラスト滑らかな形状と認識しやすいディテール
3Dモデリング7つのコンパートメントを持つ週間ピルオーガナイザーリアルな素材、ラベル、影、操作機能
3Dキネマティクス高さスライダー付きのアニメーション・シザーリフト滑らかな動きと連動する機械部品
フロントエンドデザインObservatory AIディスカバリーワークスペース洗練されたレイアウト、ライブプレビュー、アニメーション、FAQ
インタラクティブ物理バスケットボールのフリースロー体験シュート、スコア、距離、サウンド、リーダーボードが機能
フルスタック開発ReactとPythonによるタスクボード機能的なAPI、データベース保存、ドラッグ&ドロップによるステータス変更

フロントエンドデザインのテストでは、ObservatoryというAIディスカバリーワークスペースに焦点が当てられました。生成されたページには、暖色系のホワイト、ほぼブラック、エレクトリックオレンジの配色が使われ、ヒーローエリア、ライブプレビュー、アニメーションデータ、ワークフローステップ、料金情報、FAQ、CTAセクション、フッターが配置されていました。これは、Ox Alphaが単独のコンポーネントだけでなく、完全なプロダクトプレゼンテーションを組み立てられる可能性を示しています。

フルスタックテストでは、統合面が注目されます。タスクボードはフロントエンドにReactJS、バックエンドにPython FastAPI、データ保存にSQLiteを使用していました。ユーザーはタスクを作成し、列間でドラッグし、ステータスを変更し、アプリケーションのAPIレイヤーを通じてデータを永続化できました。報告された結果は3Dの例ほど視覚的に洗練されていませんでしたが、静的なモックアップよりも機能面のカバー範囲は広いものでした。

能力評価で確認された根拠最適な解釈
ビジュアル生成SVGキャラクターとインターフェースレイアウト迅速なコンセプト作成に有用
空間推論ピルオーガナイザーとシザーリフト構造化された3Dシーンに有望
インタラクションロジックスライダー、ボタン、アニメーション、操作機能ビジュアルを基本的な動作に接続可能
アプリケーションアーキテクチャReact、FastAPI、SQLiteによるタスクボード複数レイヤーのプロトタイプを作成可能
ゲームプレイロジックバスケットボールのスコアリングと距離変更シンプルなインタラクティブルールを実装可能
最も強いシグナル

Ox Alphaは、特にブラウザベースの3Dプロトタイプのように、ビジュアル出力と実際に動作するインタラクションの両方が求められるタスクで、最も魅力を発揮するようです。

Ox Alphaを自分で評価する方法

実用的なベンチマークでは、見た目の魅力と機能的な正確性を分けて評価する必要があります。固定したプロンプトから始め、モデル設定を記録し、明確な基準に照らして結果を判定してください。同じタスクを複数回繰り返すことで、優れた出力が一貫したものなのか、それとも偶然特に好条件で得られたものなのかを確認できます。

以下のワークフローは、見出しとなるスコアだけに頼らず、Ox Alphaを他のモデルと比較するのに適しています。

1

タスクを定義する

CRUDボード、機械的な3Dシーン、SVGイラスト、レスポンシブなランディングページなど、範囲を絞ったタスクを選びます。生成を始める前に受け入れ基準を書き出してください。

2

テスト条件を固定する

プロンプト、入力アセット、コンテキスト長、ツール権限、期待する出力形式を統一します。日付を2026年8月22日として記録し、インターフェースの変更点もメモしてください。

3

機能を採点する

スクリーンショットだけで判断せず、インタラクションをテストします。データの永続化、アニメーションの挙動、レスポンシブレイアウト、エラー処理、操作が要求どおりの結果を生むかを確認してください。

4

コード品質を確認する

構造、命名、依存関係、セキュリティ対策、保守性を調べます。動作するプロトタイプであっても、本番利用の前には大幅なエンジニアリングが必要になる場合があります。

5

繰り返して比較する

複数回試行し、同じ基準をモデル間で比較します。成功した出力だけでなく、失敗も同じように記録してください。

採点項目推奨される質問合格条件
要件要求された機能がすべて含まれているか?主要な要件が欠落していない
インタラクション操作、フォーム、アニメーションは機能するか?中核となる操作が説明どおりに動作する
信頼性繰り返し使用した後も結果は機能するか?再テスト中にすぐ壊れない
コード品質実装は整理され、読みやすいか?別の開発者が確認・変更できる
表現インターフェースは明確で一貫しているか?レイアウトと階層構造がタスクを支えている
安全性入力、API、ストレージは責任を持って扱われているか?明らかに危険なデフォルト設定や公開された秘密情報がない

有用なテストスイートには、簡単なプロンプトと難しいプロンプトの両方を含めるべきです。たとえば、単純なSVGリクエストと、フロントエンド、API、データベース、状態遷移を必要とする多段階アプリケーションを組み合わせます。これにより、視覚的な洗練度だけを根拠にモデルが強く見えてしまうことを防げます。

ベンチマークレビュー・チェックリスト:

  • 正確なプロンプトとモデル設定を記録する
  • テスト前に固定した受け入れ基準を使用する
  • ビジュアル品質と機能的な挙動を分けて確認する
  • 重要なインタラクションとデータの永続化を再テストする
  • 失敗、修正、最終出力の品質を記録する
テストのヒント

透明性のある基準による再現可能なローカルテストは、印象的な一回限りのデモより価値があります。モデルのバージョンを比較する際は、タスクを変更しないでください。

結果が開発者にとって意味すること

利用可能な証拠からは、複数の分野で迅速なプロトタイピングに役立つ可能性のあるモデルだと考えられます。開発者は3Dでアイデアを検討し、フロントエンドのコンセプトを作成し、シンプルなインタラクティブ体験を組み立て、フルスタック開発の出発点を生成できます。報告された結果があっても、デバッグ、コードレビュー、テスト、セキュリティ確認が不要になるわけではありません。

コーディング作業において、最も重要なシグナルはDeepSWEでの80%の結果です。プロダクト開発では、インタラクティブなデモンストレーションも同様に重要かもしれません。複数の関連要件をモデルがどのように処理するかを示しているためです。実用的なワークフローでは、まず幅広いプロトタイプを作成し、その後、人間がアーキテクチャやエッジケースを改良するという進め方が考えられます。

ユースケースOx Alphaが役立つ可能性依然として必要な人間による確認
初期プロダクトモックアップレイアウト、スタイリング、コンテンツを迅速に生成アクセシビリティ、ブランドの一貫性、レスポンシブ挙動
3Dブラウザプロトタイプジオメトリ、素材、操作機能、アニメーションパフォーマンス、衝突判定の精度、デバイス互換性
フルスタックの足場作り1つのプロジェクト内でフロントエンド、API、データベース、状態フローを構築認証、バリデーション、マイグレーション、デプロイ
教育用実験明確なビジュアルデモとインタラクティブな例正確性、説明の質、テストカバレッジ
クリエイティブコーディングSVG、モーション、物理、インターフェースのコンセプト独自性、仕上がり、保守可能な実装

いくつかの重要な制限も残っています。

  • DeepSWEの比較は、報告された10件のタスクのサンプルに基づいています。
  • 提供された資料には、完全なベンチマークプロトコルが含まれていません。
  • 利用可能な参考情報では、モデルの所有者または開発者は確認されていません。
  • デモンストレーションでは、失敗率よりも成功した出力が強調されている可能性があります。
  • パフォーマンスは、プロンプト設計、コンテキスト、ツール、実行環境によって変化する可能性があります。
  • 機能するプロトタイプが、そのまま本番運用可能なソフトウェアになるわけではありません。

テキスト、画像、動画入力への対応が報告されているため、Ox Alphaはマルチモーダルな開発ワークフローに適している可能性があります。ただし、能力を示すラベルだけで正確性が証明されるわけではありません。プロジェクトで重要になる場合は、画像解釈、動画理解、長文脈検索を個別にテストしてください。

本番運用の境界

レビューなしに、生成されたコードや生成された3D挙動を公開・運用しないでください。デプロイ前に、依存関係、入力、データ処理、パフォーマンス、障害からの復旧を検証してください。

Q: Ox Alphaの主なベンチマーク結果は何ですか?

主な報告結果は、10件のタスクを対象としたDeepSWEソフトウェアエンジニアリングテストでの80%スコアです。同じ報告では、Fable 5.5、GLM 5.3、Grock 4.6 6、GPT 5.6について、より低いスコアが示されています。

Q: Ox Alphaの80%スコアは普遍的なランキングですか?

いいえ。これは限定的に報告されたテストの結果です。利用可能な資料には、あらゆるコーディング、推論、マルチモーダル、本番運用のワークロードにわたる普遍的なランキングとして扱うための十分な方法論が示されていません。

Q: より広範な評価で最も強く見えた能力は何ですか?

インタラクティブな3Dモデリングと3Dキネマティクスが際立っており、操作機能を備えた週間ピルオーガナイザーやシザーリフトなどが含まれます。フロントエンドデザインとフルスタックプロトタイピングでも、有用な機能性が示されました。

Q: Ox Alphaを作ったのは誰ですか?

提供された情報では、Ox Alphaの開発者や運営元は確認されていません。いくつかの可能性が公に議論されていますが、検証済みの所有情報ではなく、推測の域を出ません。

結論

Ox Alphaはコーディングやインタラクティブなプロトタイピングで試す価値があります。ただし、1つのベンチマークのパーセンテージだけに頼らず、再現可能なタスクで比較してください。