MLLMs に関する報道
関連記事 2 件
HalluPrism: マルチモーダル不確実性を判断するのではなく、診断する必要がある場合
HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide
AI インサイトHalluPrism は、マルチモーダルな不確実性を「応答するかどうかの決定」から「失敗の原因の診断」に変え、視覚的な劣化、空白の画像、接地/関係プローブを通じて (V、L、A) 署名を生成します。 58,000 以上のサンプルの中で、画像除去の信頼保持が最も一般的ですが、接地/関係プローブの不安定性の方が失敗したファミリを区別するのに優れており、座標は個別に使用するよりも共同で解釈する必要があります。重要度 68/100Inter-3D VQA: 3D 時空間に基づいた視覚的な質問応答のための路側マルチモーダル ベンチマーク
Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering
AI インサイトInter-3D VQA は、交差点シーン向けの初の 3D 時空間視覚的質問応答ベンチマークを提案し、同期された点群とマルチビュー画像に基づいて 407,000 個の QA ペアを構築し、車線レベルの位置決め、物体の関係、動作パターン、および衝突寸前推論をカバーします。主に自車の視点や 2D 路側ビデオに基づいていた以前のベンチマークと比較して、この研究では 2D 知覚から実際の距離とトポロジーの 3D に基づいた推論への進歩を評価します。重要度 65/100