Location via proxy:   [ UP ]  
[Report a bug]   [Manage cookies]                

タグ

ChatGPTと画像に関するtestedqualityのブックマーク (1)

  • GPT-4Vができることをまとめてみた - 電通総研 テックブログ

    こんにちは。ISID 金融ソリューション事業部の若です。 先日、GPT-4から発展し、画像も扱うことができるGPT-4 with vision(GPT-4V)が発表されました。GPT-4Vは大規模マルチモーダルモデル(LMMs: Large multimodal models)と呼ばれるAIモデルの一種であり、GPT-4の入力として「画像」を拡張したものになります。 今日は Microsoft Researchの論文[1]を中心に、Open AIの発表したSystem Card[2]も踏まえ、GPT-4Vでできることや苦手とすること、そして実用上の制限について解説します。 GPT-4Vの特徴 ① 画像とテキストを入力にできる GPT-4Vでは、GPT-4のテキスト入力に加えて画像も入力することが可能になりました。 画像は複数枚入力することが可能であり、かつ、画像とテキストを任意に交互に組

    GPT-4Vができることをまとめてみた - 電通総研 テックブログ
    testedquality
    testedquality 2023/10/13
    OCR的に使うには日本語まだまだ厳しいです。が、表情推論とか画像内容説明とか素晴らしいのでaltつけるのに使うとかしたい
  • 1