Term

LiveCodeBench

Overview

最終更新: 2026年7月9日

大規模言語モデル(LLM)のプログラミング能力を客観的に評価するためのベンチマークプラットフォーム。定期的に新しいコーディング問題を追加・更新することで、モデルが学習データとして問題を記憶している「データ汚染」の影響を排除し、未知の課題に対する純粋な推論・生成能力を測定することを特徴としている。

Mentioned Articles

1 件

External Mentions

10 件