ベンチマーク

AIエージェント

OSWorld: オープンエンドなタスクのためのマルチモーダルエージェントのベンチマーク

はじめにOSWorldは、実際のコンピュータ環境でオープンエンドなタスクを実行するマルチモーダルエージェントのベンチマークです。このリポジトリでは、環境、ベンチマーク、プロジェクトページが提供されています。主な特徴は以下の通りです:実際のデ...
ベンチマーク

TTS Arena: 実際の環境でテキストから音声へのモデルを評価する

TTS Arena: Benchmarking Text-to-Speech Models in the Wildこちらの記事の日本語版です。導入 (Introduction)テキストから音声への変換モデル(TTSモデル)の品質を自動的に測...