PyCon mini 東海 2024で発表してきました & レポート

はじめに Pycon mini 東海 2024 でトーク発表してきました。今年は全然LTとか発表していなくて、ここでの発表で今年2回目でした。久々すぎて緊張しましたね。。。( ´ー｀)y-~~でも、オフラインの発表でしか出ない脳汁があることを再認識しました会場は、中…

2024-10-19

Janus-1.3B を Colaboratory でお試し🦔

Colaboratory VLM 機械学習

1.3B と言う軽さで、画像認識も画像生成も出来るJanusを味見しています。ただ、研究として異議はあるかもですが、運用として認識も生成もしたい状況ってないんですよねー。この構造のおかげで1.3Bと言う軽さに寄与している？性能は中々だと思います。ただ、…

2024-10-15

OpenAI の Swarm で画像認識したり、処理の移譲をするメモ🐝

機械学習 Colaboratory VLM LLM OpenAI

以下を試したときのメモをZennに書きましたまあ、正直小細工ではあります。すぐにこんな小細工も必要ないくらいGPT進化すると思っていますが。。。 OpenAIのSwarmさんで画像認識を試しています。とりあえず、GPT-4o miniが苦手な座標取得を依頼された時に、F…

2024-09-27

Phantom を Colaboratory でお試し🦔

Colaboratory 機械学習 VLM

Molmoより先に試していたのですが、、、Molmoが突如現れて、一部の認識機能（位置把握とかカウント能力）でちょっと衝撃的だったので、後回しにしてしまっていました。。。一番小さいモデルで0.5BのVLMです。ただ、Flash Attention採用してて、Ampereアーキ…

2024-09-26

Molmo を Colaboratory でお試し🦔

機械学習 VLM Colaboratory

VLMもじゃんじゃんリリースされますね。Apache2.0 の OSS で GPT4V より認識性能が高いらしいです GPUメモリ的にColaboratoryだとA100必須だけど、このVLMの性能は凄いな2枚目は可視化したものだけど、位置も良さそう pic.twitter.com/J4NvC7CrT5 — 高橋か…

2024-09-16

Phi3.5-Vision を Colaboratory でお試し👀

VLM Colaboratory

とりあえず動かしたノートブックです。ちょっと色々試す時間なかったので、いったん共有です👻 github.com

2024-09-04

Qwen2-VLをColaboratoryでお試し🦔

機械学習 VLM Colaboratory

Alibaba が公開した Qwen2-VL を Colaboratoryでお試ししていますいくらか試していますが、かなり認識性能が高い気がします。多言語対応していて、日本語入力、日本語回答が出来るのもポイント高いですね。そういえば、オープンな重みで日本語入力、日本語…

2024-08-30

Large Language Mario：VLMはやっぱり位置関係の把握が苦手🍄？

VLM 機械学習

苦手です ※2024年8月30日現在と言うか、前々から色々なVLMに対して言及されていた課題ではありますが、、、（特にGPT4Vで指摘されることが多い印象）お仕事でプロトタイプ検証した時も感じておりましたが、仕事の内容なので、はてブに書くわけにもいかず、…

2024-08-20

MiniCPM-V2.6 を Colaboratory でお試し🔍

機械学習 Colaboratory VLM

MiniCPM-V2.6 は、単一画像、複数画像、動画などを処理できるマルチモーダルLLMです。個人的な感想ですが、この手のローカルで動かせるVLMで、複数画像や動画を処理できるものは珍しい気がしますね MiniCPM-V2.6は、公式の説明では以下のような特徴があるら…

2024-08-17

Florence 2 を Colaboratory でお試し🔍

機械学習 VLM Colaboratory 物体検出 Semantic Segmentation

Microsoft が公開している軽量VLMのFlorence 2をColaboratoryで味見しています。 Florence 2 は以下のようなタスクが実行できるモデルです。一般的にVLMで言う、フリーワードでのプロンプトではなく、タスクに応じたプロンプトの指定が必要です。 CAPTION：…

2024-08-17

MobileVLM V2 を Colaboratory でお試し🔍

機械学習 VLM Colaboratory

軽量なVLMのMobileVLM V2です。以下はシンプルなプロンプトですが、T4 GPUで約250msとかなり早いですそーいえば、MobileVLMも触りかけて放置してたのですが、Colaboratoryで改めて触りましたシンプルなプロンプトですが、T4 GPUで約250msと言うのは流石に早…

2024-06-20

サイバーエージェントのVLM（LLaVA-CALM2-SigLIP）を Colaboratory で味見👀

VLM Colaboratory

サンプルスクリプト動かしただけですが、、、精度良さそうな気がします遅くなったけど、サイバーのCALM2の日本語VLMをColabで味見した最低L4のGPUじゃないとメモリ不足で動かない pic.twitter.com/5KKQxCxqLP— 高橋かずひと@闇のパワポLT職人 (@KzhtTkhs)…