2025-01-01から1年間の記事一覧
はじめに 12/25(木)に仕事納めしました(26(金)は所用で有給休暇取得) 冬休み中は、以下のノードエディター作ったり、年明けのLT資料や登壇資料を作ってすごす予定です おまえ、またノードエディター作っとんのかい。と言われそうだけど、冬休み中に初回リ…
ネタがねえ。ネタがねえ。とか言いつつなんだかんだ7記事投稿しています🦔 12/4 12/5 12/10 12/13 12/15 12/17 12/24 以上。
株のデイトレード自体は8年くらい前に手を出して、全然ダメダメだったので、それ以降は積立投資のみをやっていました。 システムトレード自体にも興味あったのですが「株を勉強する情熱ないしな。。。( ´ー`)y-~~」と思って手を付けていませんでした。ふと…
Sarashina2.2-Visionを味見していますSB Intuitionsが開発した日本語VLMで、Sarashina2-Visionの後継ですね。 Sarashina2と比べて日本語の理解力が上がっています3Bのわりに推論は重い気がしますが(L4 GPUで1分とか) sarashina2.2-vision-3bさん、日本の理…
人検出+属性検出+深度推定のマルチタスクモデルですGradioアプリ化してColaboratoryで実行T4 GPUだと少し苦しいか、5fps(選択したモデルのサイズにもよる) デプスをインスタンスセグメンテーションで切り抜く表示オプションを入れるの忘れてた pic.twitt…
視線推定の味見です。今回はGradioアプリ化してColaboratoryで実行T4 GPUとかでもギリ10fpsとかでますね(選択したモデルのサイズにもよる) お試し用に474_Gaze-LLE-DINOv3をGradioアプリ化したけど、これソースコードが長大になって取り扱いどーすっかなー…
ColaboratoryでStreamlitを起動するメモです。もう少し正確に言うとColaboratoryで起動したStreamlitをトンネルして、公開URLにしてアクセスするメモです👀 zenn.dev
Qwen3-VL を味見 Qwen2-VLやQwen2.5-VLも性能高くて良かったのですが、Qwen3-VLは、多様なタスク(2D物体検出や3D物体検出、OCRなど)をサポートし、日本語性能も高いので大変良いです。また個人的にはT4 CPU(2B、4B、8Bあたり)で動くのがポイント高いです…
はじめに PyCon mini 東海 2025 でトーク発表してきました。最近は、お世話になってたいくつかの勉強会が休眠状態になっていたり、プライベートがバタバタしていたりで、Pycon mini 東海、Pycon mini Shizuoka、NGKの3つだけ参加することが多いです。あ、今…
こんなやつ↓Xのサムネイル表示時は白背景で、クリック後は黒背景になることを利用したトリック画像ですね(もちろんダークモードだと動かない)書い 一度自分で作ってみたかったのでPythonで生成してみました 試しに投稿してみたものはこちら↓ 一度やってみ…
性能が良い物体検出モデルDEIMのv2です。個人的には以下の表のとおり、AttoやFemto、Picoなど超軽量系のラインナップがあるのが凄く好みです 直近で使う予定はないのですが、使いたくなった時にすぐ使えるように、いつも通りONNX変換とColaboratory上でのト…
入力した音声のノイズ低減と音声強調を行うモデルです。 軽量を謳っているモデルなのですが、Griffin-Limアルゴリズム(反復処理 & 出力チャンクより未来のデータが必要)を採用しているため、僕が使いたい用途では使いにくいため、リポジトリ公開して供養👻 g…
劣化した音声をデノイズした上で、復元するモデルです。僕の使いたい用途には重すぎて、使い道がなくなってしまったので、リポジトリ公開して供養 ちょっと古いモデルですが、精度は結構良いと思います 供養供養ONNX変換したけど、僕の使いたい用途には重す…
以下を追加しています。もう少し機能追加するまで、しばらくリリースするつもりは無かったのですが、Silero VAD の v6 が結構精度向上されていたので、リリースすることにしました🦔 ・Magunitude Squared Coherenceノード追加・Silero VAD を v6 に更新 githu…
インスタンスセグメンテーションです。 特徴的な構造として、このモデルには物体検出部分は含まれないため、自分の好きな物体検出モデルの検出結果と組み合わせて使用します。そのため、このモデルの入力は、画像とROIの2入力です セグメンテーション結果は…
LFM2-VL をお試ししています軽量なVLMです。CPUでも多少時間かかりますが動作します。ただし、ライセンスがちょっと独特なので、状況によっては仕事とかだと使いにくいかも。 LFM2-VL を味見しているかなり軽量(450M、1.6B)でCPU推論も何とか動くっぽい。…
SmolVLM2の味見をしています比較的軽量(256M、500M、2.2B)なVLMですが、Flash Attention2 必須のため、Ampere GPU以上(L4以上)が必要です。 SmolVLM2の推論味見と、ファインチューニング味見をしているただ、ファインチューニングの確認に使っている医療…
いや、リリース自体は先週には実施していたのですが、、、書き忘れていました。 以下を追加しています。僕が趣味で欲しい機能や、仕事で欲しかった機能を追加しています。 Zeroノード追加 ループバック(Windows)ノード追加 Videoノードを高速化 上記みたい…
実は仕事ではちょいちょい縁のあるReSpeakerさんですいくつかの現場で遭遇しています。大体の場合は「あまり高価ではないデバイスで上手いこと音声認識したい」みたいな状況ですが 仕事で検証した内容を、表にアウトプットするのも微妙な現場で触ることが多…
久々に、Image-Processing-Node-Editor をリリースしました更新内容は、HSVノード追加、セピアノード追加、バグ修正、Windows exe更新。です。 ついでに、Audio-Processing-Node-Editor もリリースしました。既にv0.2.0になっていますが、扱いは初回リリース…
Gemini-2.5 で物体検出が対応したと聞いたので、ColaboratoryでAPIを試してみています Gemini-2.5-Flash で 物体検出とセグメンテーション味見している物体検出はFlorence-2と同等かちょっと悪い?プロンプトの柔軟性はGemini(2枚目のプロンプトは”Find the…
Voxtral-Mini-3B を味見しています3Bでありながら、それなりのチャット性能を持ち、テキスト+オーディオへの回答や、文字起こしなども出来るモデルです。3Bの他に24Bも公開されていますが、fp16でGPU RAMが55GB必要らしいので、僕の扱える環境では動かすこ…
Claude Code は 会社のお金で試すので、趣味開発ではGemini CLI を試してみています ミニゲーム作成を試すのも良いのですが、今回は Image-Processing-Node-Editor と Audio-Processing-Node-Editor の ノード追加をまかせてみました 以下は、Gemini CLI に…
個人的なお話ですが、ちょっと本業だと、オプトアウトの問題とか、AIが苦手な分野?なのか上手くコードが作れない。とかで、CLAUDE CODEとかGemini CLIをイマイチ上手く活用できていませんでした 今回は、個人的な趣味でミニゲームやツールなどをいくつか作…
GLM-4.1V-9B-Thinking を味見しています👀 GLM-4.1V-9B-Thinking 味見している👀<think>てタグと、<answer>ってタグが推論結果にある pic.twitter.com/lQKSI9hkr7 — 高橋 かずひと@パワポLT職人 (@KzhtTkhs) 2025年7月5日 著者曰く、9Bというモデルサイズでありながら、18のベン</answer></think>…
AppleのFastVLMを味見しています出力トークン数が少なくなるようにすれば、それなりに早いです。 試してから気付いたのですが、Apple独自ライセンスのため、正直使いにくいと思います。 FastVLMを味見アウトプットを短くすれば、そこそこ早い pic.twitter.co…
Chaquopyは、AndroidアプリにPythonを組み込めるようにする開発ツールですカメラ画像を取得してOpenCVを動かしてみました。 Zenn投稿用。Chaquopy を用いて Android 上で Python OpenCV カメラのテスト pic.twitter.com/YTHOTA0XlP — 高橋 かずひと@パワポLT…
Dense Point Tracking の alltracker を味見しています追跡性能はかなり高いと思います。が、GPU RAMはがっつり食います alltracker味見している精度は良いと思うんだけど、GPU RAM食うなーこれ。。。 pic.twitter.com/RxUZtv9nyg — 高橋 かずひと@パワポLT…
今回は、試した結果のみでソースコードとかノートブックの共有は無いです EdgeTAM を Colaboratory で味見しているまあ、サンプル動画はうまくいくよね pic.twitter.com/3wK4xKbOn8 — 高橋 かずひと@パワポLT職人 (@KzhtTkhs) 2025年6月21日 EdgeTAM いじめ…
Kimi-VLを味見しています精度は良いのでしょうけど、、、試した例では、L4 GPUで推論が3分かかって、ちょっと重い感じするなー Kimi-VL味見Q.What is the dome building in the picture? Think step by step(写真のドーム型の建物は何でしょうか?段階的に…