Multimodal Large Language Models に関する報道
関連記事 1 件
命令の抽出: 視覚的な例としてのテキスト命令
Instruction Distillation: Text Instructions as Visual Examples
AI インサイトこの論文では命令の蒸留を提案しています。大規模なマルチモーダル モデルがトレーニング画像ごとにテキスト認識命令を生成し、視覚的なコンテキスト学習のために画像の例をテキストの例に置き換えて、推論中のトークンの消費を削減しながらクラス内の多様性を維持します。カテゴリごとに 1 つの記述しかなかった従来と比較して、今回はグラフに従って指示が生成されるため、大規模な K をきめ細かく分類するための展開のしきい値が低くなります。重要度 65/100