2024-01-01から1年間の記事一覧
以下の続きです。 ちょっとymlファイルが多いですが、あまり癖のないトレーニングコードで、サクッとColaboratoryで動かせました RT-DETR(v2)をColaboratoryでトレーニングするサンプルも放流https://t.co/EuKfAaR701 pic.twitter.com/pIk8vY0rCk — 高橋 か…
そーいえば、RT-DETR(v2)触ったことなかったな。と思って軽くお試し あー、CPU(Core i7-8750H CPU)だと思ったより早くて、GPU(GeForce GTX 1050 Ti)だと思ったより遅いな、、、いや、GPU古いってのもありますが、、、新しめのGPUだと速いんだろーなって雰囲…
かなーり昔に作ったセグメンテーションモデルの続編ですね。 元々目指していた方向性が、MediaPipeのSelfieMultiClassで達成できてしまうので、方向性を変えてイラストも追加して学習してみました。 正直、精度はまだまだイマイチです。以下みたいな感じ ま…
Molmoより先に試していたのですが、、、Molmoが突如現れて、一部の認識機能(位置把握とかカウント能力)でちょっと衝撃的だったので、後回しにしてしまっていました。。。 一番小さいモデルで0.5BのVLMです。ただ、Flash Attention採用してて、Ampereアーキ…
VLMもじゃんじゃんリリースされますね。Apache2.0 の OSS で GPT4V より認識性能が高いらしいです GPUメモリ的にColaboratoryだとA100必須だけど、このVLMの性能は凄いな2枚目は可視化したものだけど、位置も良さそう pic.twitter.com/J4NvC7CrT5 — 高橋 か…
とりあえず動かしたノートブックです。ちょっと色々試す時間なかったので、いったん共有です👻 github.com
CartoonSegmentation触った関連と言うことで、Anime-Segmentation を触っています。ちょっとタスクは違いますが。。。(CartoonSegmentationはインスタンスセグメンテーション、Anime-Segmentation はセマンティックセグメンテーションによる前景抽出、のよ…
SegGPTを試しています。 SegGPTをColaboratoryでお試ししているリファレンス画像とマスク指定を用意して、対象物のセグメンテーションを行うモデルですね pic.twitter.com/syYtm4uYCr — 高橋 かずひと@闇のパワポLT職人 (@KzhtTkhs) 2024年9月11日 試すだけ…
CartoonSegmentation のオリジナルはmmcv関連のパッケージがインストール必要で、ちょっと環境構築が面倒だったのですが、ONNXに変換してくれているリポジトリがあったため、Colaboratoryで試してみました。 CartoonSegmentationのONNX助かるーオリジナルリ…
CoLIEと言うアルゴリズムのLLIEです。 画像毎にtrain()を回して適応する仕組み上、現時点のONNX変換は不可ですただ、個人的な初見ですが、最近見たLLIE系の中では一番補正性能高いと思います。ただし、処理時間はそれなりに必要なので使いどころは考える必要…
生成AI全盛期の今では、正直あまり使いどころもありませんが、、、個人的にはWhite-box-Cartoonizationで変換された風景とか、味があって好きです もう4年くらい前のモデルだけど、今でも風景に対してのWhite-box-Cartoonizationの変換結果、味があって好きT…
Alibaba が 公開した Qwen2-VL を Colaboratoryでお試ししていますいくらか試していますが、かなり認識性能が高い気がします。多言語対応していて、日本語入力、日本語回答が出来るのもポイント高いですね。 そういえば、オープンな重みで日本語入力、日本語…
昔作ったサンプルのフルリニューアルです。 8ヶ月ほど遅いですが、レガシーソリューションから新ソリューションにリニューアルしましたtfliteファイルやtaskファイルをインスタンス生成時にロードする仕様に変わっているやつです。個人的には1枚目のSelfieMu…
ある程度近い距離だと綺麗に抜けますね複数人とか遠いとかだとイマイチなので、人検出と組み合わせたりしないとですが。 4年くらい前のU-Netベースのモデルですが、衣服セグメンテーション味見している眼鏡は衣服か、、、アイウェアだしそうか、、、? pic.t…
苦手です ※2024年8月30日現在 と言うか、前々から色々なVLMに対して言及されていた課題ではありますが、、、(特にGPT4Vで指摘されることが多い印象) お仕事でプロトタイプ検証した時も感じておりましたが、仕事の内容なので、はてブに書くわけにもいかず、…
難解プログラミング言語のソースコードを普通の言語で生成するという虚無👻 zenn.dev
完全に個人的なメモです。Zennのスクラップです。 これ毎回ググってんな。。。とか、これ毎回GitHubで自分のリポジトリ検索かけてるな。。。みたいなやつを整理しています👀 zenn.dev
MiniCPM-V2.6 は、単一画像、複数画像、動画などを処理できるマルチモーダルLLMです。個人的な感想ですが、この手のローカルで動かせるVLMで、複数画像や動画を処理できるものは珍しい気がしますね MiniCPM-V2.6は、公式の説明では以下のような特徴があるら…
Microsoft が 公開している軽量VLMのFlorence 2をColaboratoryで味見しています。 Florence 2 は以下のようなタスクが実行できるモデルです。一般的にVLMで言う、フリーワードでのプロンプトではなく、タスクに応じたプロンプトの指定が必要です。 CAPTION:…
軽量なVLMのMobileVLM V2です。以下はシンプルなプロンプトですが、T4 GPUで約250msとかなり早いです そーいえば、MobileVLMも触りかけて放置してたのですが、Colaboratoryで改めて触りましたシンプルなプロンプトですが、T4 GPUで約250msと言うのは流石に早…
いわゆる顔交換ですねオリジナリティ等あんまないので、Zennスクラップ行きです。 inswapper でのフェイススワップこれに関しては完全に趣味だな、、、仕事じゃ絶対使わんし 1枚目:交換元画像 2枚目:交換先画像 3枚目:交換結果 pic.twitter.com/PdvrskzDK…
NSFW(Not Safe For Work:職場での閲覧注意)画像の判定ですNSFWと言ってもアダルト判定のみでグロとか暴力とかは対象外。 やりかけで放置していたサンプルソースがポコポコ出てくる、、、これはNSFWモデルをONNX変換したもの。たしか一時期Stable Diffusio…
MVANetです。BiRefNetと同じくDIS(Dichotomous Image Segmentation)モデルです。 あくまで、個人的な感覚ですが、BiRefNetの半分くらいの推論速度で、精度はそれなりと言う感じです重みファイルも半分くらい(約440MB) お試ししたソースコードは以下にコ…
雨除去と言うか水滴除去ですかね後処理がちょっと珍しい感じです。性能はボチボチ? 310_attentive-gan-derainnetちょっと珍しい後処理と言うか出力の補正が必要各チャンネルごとにスケーリング pic.twitter.com/eLjxGEmL17 — 高橋 かずひと@闇のパワポLT職…
BiRefNetをONNXに変換して動作を味見しています。いわゆるDIS(Dichotomous Image Segmentation)モデルです。背景除去、背景分離、Salient Object Detectionとか呼ばれたりもする?Salient Object Detectionは違うか? ONNX変換後の重みファイルが1GB弱あっ…
LLIE(Low Light Image Enhancement)のDiffusion-Low-Lightです。個人的な感想ですが、正直、性能に対して重い、、、 過去に、動物園のDiffusion Low Lightを味見しようとした形跡があったのだけど、何で途中でやめたんだっけ。。。仕事忙しくなったとかかし…
Zennに投稿しました。 OpenVINOさん、Colaboratory上でもサクッと動くようになったし、PaddlePaddleのモデルを直接読み込めるし、僕的には結構使い道ありそう zenn.dev ノートブックは以下のリポジトリで公開しています。 github.com 追記: 推論時間の比較↓…
Crowd Counting(群衆カウント、群衆密度推定)のモデルであるMPCountを味見しています 少し余裕が出てきたので、いくつか味見をしているこれは CVPR2024 paper "Single Domain Generalization for Crowd Counting" pic.twitter.com/XcCOCNNAsn — 高橋 かずひ…
先週お試ししていましたが、ちょっとバタバタしてて放置してしまっていました。。。 SAM2が発表されたので味見していましたが、これは凄いですね。静止画はちょっとSAMからの進歩分かりにくいですが、Videoトラッキングは結構エグイ うわ、SAM2(Segment Any…
スクラップメモです👀人生で2回目に必要になったので、忘れないようにメモ。 zenn.dev