Appleが開発 スマホに特化したマルチモーダルLLM『Ferret UI』

「スマホ画面上のオブジェクトを理解するの...
Read More

時系列分析におけるLLMの可能性について

Microsoftなどの研究者らは、LL...
Read More

ChatGPTと実際に交わされた会話の世界最大規模データセット「WildChat」

コーネル大学などの研究者らは、ChatG...
Read More

画像認識

「視覚は本来、言語に依存しない」と考えた研究者らが、言語データなしで大規模ビジョンモデル(LVM)を構築するアプローチを開発
画像分析機能を持つオープンソースLLM『LLaVA-1.5』登場。手持ちの画像を分析可能。GPT-4Vとの違い
「1枚絵の3D化」が非常に手軽な操作で実行できる軽快なツール『DreamGaussian』とWebでの使い方
OpenAI、ChatGPTが画像を分析する『GPT-4V(ビジョン)』を発表。安全性、嗜好性、福祉機能を強化
数式や文章がぐにゃぐにゃに曲がった論文PDFでもくっきり認識する画期的なOCR『Nougat』
ロボットが「初めて見る環境」で「初めて聞く指示」に対しても行動をとれるようにする
未知の物体を認識し、それを既知の物体と区別する新たな研究 BMWやGoogleなど
SAMを利用した新たな異常検知フレームワーク「SAA+」の紹介

業界/カテゴリー

PAGE TOP