ベンチマーク結果
Ox Alpha ベンチマーク
Artificial AnalysisおよびコミュニティによるテストのOx Alphaベンチマーク結果と評価を紹介し、推論とコーディングにおける性能を扱います。
Ox Alpha のベンチマークとは?
ベンチマークは、標準化されたAI評価やコミュニティが設計したテストでOx Alphaがどの程度の性能を発揮するかを測定します。このカテゴリでは、Artificial Analysisや独立したレビュアーが公開した結果を追跡し、推論、コーディング、エージェントタスクの性能スコアを扱います。
ベンチマークを追う理由
1
実際の性能を比較する
標準化された推論・コーディング評価において、Ox Alphaが最先端モデルと比べてどのようなスコアを獲得するかを確認できます。
2
誇大広告に惑わされない
独立した評価結果やコミュニティテストを利用して、匿名で宣伝されているモデルの情報だけに頼らず性能を判断できます。
3
スコアの更新を追跡する
テスターが評価を再実行し、OpenRouterがモデル掲載情報を更新する中で、ベンチマーク結果がどのように変化するかを追えます。
注目・必読
すべてのベンチマーク
ガイド
Ox Alphaベンチマーク:初期スコア、コンテキスト、モデル比較
報告されているOx Alphaベンチマークの結果、コンテキストウィンドウ、マルチモーダル機能、信頼性の限界、競合AIモデルとの比較を確認します。
ガイド
Ox Alpha evals:ベンチマーク、セットアップ、安全対策
匿名AIモデル Ox Alpha の評価、報告されたベンチマーク、実践的なテスト方法、アクセス方法、プライバシー対策を紹介します。
ガイド
Ox Alphaのパフォーマンス:ベンチマーク、レイテンシ、コーディングテスト
スループット、レイテンシ、信頼性、コーディング、マルチモーダル入力、長時間実行のエージェントワークロードにおけるOx Alphaのパフォーマンスを確認します。