MLLM に関する報道
関連記事 5 件
解釈可能な生成制御を使用したギブズ サンプリングによる MLLM の知覚事前分布の調査
Probing Perceptual Priors of MLLMs via Gibbs Sampling with Interpretable Generative Controls
MLLM はリソースの少ないクメール語文書を本当に理解しているのでしょうか?クメール文書 VQA に関するパイロット研究
Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA
視覚的な境界を超えて: 映画 RAG のシーン セグメンテーションを再考する
Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG
AI インサイト本稿では、映画RAGの検索単位としてシーン分割を提案する。以前の固定長セグメントと比較して、ストーリーレベルの意味境界が初めてビデオ検索に体系的に導入されました。要約では問題設定のみが説明されており、実験結果はまだありませんが、RAG の品質がセグメンテーション粒度の方向によって制限されることを示しています。重要度 62/100ClearText-Video: ビデオの復元とシーン テキストの強化を橋渡しする大規模なテキスト中心のビデオ データセット
ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement
AI インサイトClearText-Video は、モーション ブラー、圧縮アーティファクト、ノイズ、低解像度などの品質低下をカバーする、テキストが豊富な 4,639 本の実際の一人称ビデオのベンチマークを構築します。ほとんどが静的または高品質のビデオであった以前のテキスト ベンチマークと比較して、実際の品質の条件下で MLLM のテキストの読み取りと推論をテストするために、統合された評価フレームワークにビデオの復元とシーン テキストの強化が初めて組み込まれています。これは、テキスト中心のビデオ理解の研究が、「読めるかどうか」から「画質が悪くても読めるか」に移行したことを意味します。重要度 68/100DocIntent: 現実世界のドキュメントの視覚的な質問応答のための、応答性ガイドに基づくエージェント復元
DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering