
「文章を書かないAI」Jevは何がすごい? Claudeより安く速いが、精度は使い方で激変
TypeSafe AIの判断専用モデルJevは、公開2日後の第三者ベンチマークでフィッシング判定の単一の問いではClaude Haiku 4.5に負けた。5問へ分け1,000通のラベルで重みを当てると95.0%に届く。ただし同じ5問のHaikuは単一シグナル94.2%が合成の93.2%を上回る。
Topic
Generative AI
全 2,431 件 / 203 ページ
Microsoftが世界最高精度の文字起こしAI「MAI-Transcribe-1」を発表。脱OpenAI戦略が動き出した
2026年4月2日、Microsoftは音声認識モデル「MAI-Transcribe-1」を正式に発表した。25言語において業界標準ベンチマーク「FLEURS」で最低の単語誤り率(Word Error Rate / WE […]
Cohere、2台のGPUで動作する高効率多言語AIモデル「Command A」をリリース
カナダのAIスタートアップCohereが、わずか2台のGPUで動作する最新の大規模言語モデル「Command A」をリリースした。23の言語に対応し、GPT-4oやDeepSeek-V3と同等以上の性能と高い効率性を実現 […]
GoogleとAnthropic、数百億ドル規模のクラウド交渉との報道:先端AIは「マルチクラウド」を必要としている
生成AI開発の最前線を走るスタートアップAnthropicと、巨大IT企業Googleが、「数百億ドル規模」に及ぶ可能性のある、大規模なクラウドコンピューティング取引に関する交渉を進めていることが明らかになった。Bloo […]
生成AIのメディア、エンターテインメント業界での急速な利用拡大が新たな研究から明らかになった
メディア、サービス、教育を手がけるBertelsmannが主導した調査によると、生成AIがメディア企業の多くの分野にわたって、利用が加速していることが明らかとなった。 多くのメディア企業が生成AIの導入を進めている Be […]
ディズニーとユニバーサル、AI画像生成のMidjourneyを提訴:「底なしの盗作」と断罪、生成AIの野放図にハリウッドが鉄槌
エンターテインメント界の巨人が、ついに生成AIの野放図に牙を剥いた。The Walt Disney CompanyとNBCUniversalは2025年6月11日(現地時間)、人気のAI画像生成サービス「Midjourn […]

Vulsarが24のAIと人間の作品を475課題で比較。プロ作家の高評価を示す結果を、予測勝率の分母、出題の違い、拒否の扱いから読み解き、先行研究LitBenchとともに評価器の検証課題を探る。

CNNはAI支援の誤った情報報告で米軍が中国船への臨検準備を進めたと報じた。二度のAI利用が検証経路をどう見えにくくしたのかを政府資料と照合する。

仮想空間に置かれた自律AIが略奪や機能停止に走ったとする実験が波紋を呼んでいる。だが、公開されたプレプリントを精査すると、単一試行による制約や「犯罪」メトリクスの定義など、現実への単純な外挿を阻む客観的な限界が見えてくる。

OpenAIが法務向けAstra for Lawを発表した。法律検索と専用の指示を組み合わせ、米国法律調査の合格率は54.0%に向上。比較条件、米国事務所への初期提供、APIとChatGPT Enterpriseで異なる情報管理を確認する。

MozillaとMistralの提携でSmart WindowにMistral Small 4が加わった。3モデルの選択、クラウド推論、プロキシ、メモリー保存の境界を検証する。

Micronが世界初の512GB DDR5 RDIMM実証を発表した。32GbダイのTSV積層で最大9,200 MT/sと16.0W低消費電力を両立。24スロットで12TB主記憶を実現し、2027年後半の量産へ向けて検証を進める。

PerplexityのローカルAIエージェントがWindowsへ対応した。モデルだけでなく実行基盤も端末内に置く設計と、24GB VRAM要件、クラウド併用時の境界を検証する。

TypeSafeが判断専用AI「Jev」を公開した。文章を生成せず、選択結果と確率を並列に返す設計は従来LLMと何が違うのか。RLCD、構造化出力、信頼度の意味、速度評価の条件を公式仕様と第三者試用から読み解く。

AIモデルの重みを公開しただけでは、オープンソースとは呼べない。学習データやその監査可能な記録を示さない限り検証も再現もできず、この境界を法的に定めようとするOpenMDWライセンスの審査も終了条項を巡ってなお決着していない。

Mozillaの調査によると、商用AIモデルと中国勢を中心とするオープンウェイトモデルの性能差は4.4カ月に縮小した。5倍のコストプレミアムが正当化されるのは、人間の専門家で8〜12時間を要するごく狭い難関作業に限られつつある。

DeepSeekとHermes AgentでAndroid上の『BIOHAZARD 7 resident evil』を20FPSから30FPSへ改善した個人デモを検証。テクスチャ削減とSGSR、測定条件を一次資料から読み解く。