高橋かずひとのプログラミング、その他、備忘録。

日々調べてたことや、作ってみたものをメモしているブログ。 お決まりの断り文句ですが、このブログに書かれている内容は個人の見解であり、所属する組織の公式見解ではありません。チラ裏。

2025-01-01から1年間の記事一覧

2025年振り返り

はじめに 12/25(木)に仕事納めしました(26(金)は所用で有給休暇取得) 冬休み中は、以下のノードエディター作ったり、年明けのLT資料や登壇資料を作ってすごす予定です おまえ、またノードエディター作っとんのかい。と言われそうだけど、冬休み中に初回リ…

2025年に投稿したアドベントカレンダー記事🦔

ネタがねえ。ネタがねえ。とか言いつつなんだかんだ7記事投稿しています🦔 12/4 12/5 12/10 12/13 12/15 12/17 12/24 以上。

Pythonで日本株の自動売買システムトレードに入門しました🦔

株のデイトレード自体は8年くらい前に手を出して、全然ダメダメだったので、それ以降は積立投資のみをやっていました。 システムトレード自体にも興味あったのですが「株を勉強する情熱ないしな。。。( ´ー`)y-~~」と思って手を付けていませんでした。ふと…

Sarashina2.2-Vision を Colaboratory でお試し🦔

Sarashina2.2-Visionを味見していますSB Intuitionsが開発した日本語VLMで、Sarashina2-Visionの後継ですね。 Sarashina2と比べて日本語の理解力が上がっています3Bのわりに推論は重い気がしますが(L4 GPUで1分とか) sarashina2.2-vision-3bさん、日本の理…

PINTO_model_zoo:人検出+深度推定(473_HISDF)をGradioアプリ化して味見👀

人検出+属性検出+深度推定のマルチタスクモデルですGradioアプリ化してColaboratoryで実行T4 GPUだと少し苦しいか、5fps(選択したモデルのサイズにもよる) デプスをインスタンスセグメンテーションで切り抜く表示オプションを入れるの忘れてた pic.twitt…

PINTO_model_zoo:人検出+視線推定(474_Gaze-LLE-DINOv3)をGradioアプリ化して味見👀

視線推定の味見です。今回はGradioアプリ化してColaboratoryで実行T4 GPUとかでもギリ10fpsとかでますね(選択したモデルのサイズにもよる) お試し用に474_Gaze-LLE-DINOv3をGradioアプリ化したけど、これソースコードが長大になって取り扱いどーすっかなー…

Zenn:ColaboratoryでStreamlitを起動するメモ(cloudflared使用)

ColaboratoryでStreamlitを起動するメモです。もう少し正確に言うとColaboratoryで起動したStreamlitをトンネルして、公開URLにしてアクセスするメモです👀 zenn.dev

Qwen3-VL を Colaboratory でお試し🦔

Qwen3-VL を味見 Qwen2-VLやQwen2.5-VLも性能高くて良かったのですが、Qwen3-VLは、多様なタスク(2D物体検出や3D物体検出、OCRなど)をサポートし、日本語性能も高いので大変良いです。また個人的にはT4 CPU(2B、4B、8Bあたり)で動くのがポイント高いです…

PyCon mini 東海 2025で発表してきました & レポート

はじめに PyCon mini 東海 2025 でトーク発表してきました。最近は、お世話になってたいくつかの勉強会が休眠状態になっていたり、プライベートがバタバタしていたりで、Pycon mini 東海、Pycon mini Shizuoka、NGKの3つだけ参加することが多いです。あ、今…

X(旧Twitter) で クリックすると画像が変わるやつを作るPythonスクリプト🦔

こんなやつ↓Xのサムネイル表示時は白背景で、クリック後は黒背景になることを利用したトリック画像ですね(もちろんダークモードだと動かない)書い 一度自分で作ってみたかったのでPythonで生成してみました 試しに投稿してみたものはこちら↓ 一度やってみ…

DEIMv2 の ONNX変換 と Colaboratory上でのトレーニング👀

性能が良い物体検出モデルDEIMのv2です。個人的には以下の表のとおり、AttoやFemto、Picoなど超軽量系のラインナップがあるのが凄く好みです 直近で使う予定はないのですが、使いたくなった時にすぐ使えるように、いつも通りONNX変換とColaboratory上でのト…

音声強調モデル LiSenNet をONNXに変換🦔

入力した音声のノイズ低減と音声強調を行うモデルです。 軽量を謳っているモデルなのですが、Griffin-Limアルゴリズム(反復処理 & 出力チャンクより未来のデータが必要)を採用しているため、僕が使いたい用途では使いにくいため、リポジトリ公開して供養👻 g…

音声復元モデル VoiceFixer をONNXに変換🦔

劣化した音声をデノイズした上で、復元するモデルです。僕の使いたい用途には重すぎて、使い道がなくなってしまったので、リポジトリ公開して供養 ちょっと古いモデルですが、精度は結構良いと思います 供養供養ONNX変換したけど、僕の使いたい用途には重す…

Audio-Processing-Node-Editor v0.4.0 をリリースしました👀

以下を追加しています。もう少し機能追加するまで、しばらくリリースするつもりは無かったのですが、Silero VAD の v6 が結構精度向上されていたので、リリースすることにしました🦔 ・Magunitude Squared Coherenceノード追加・Silero VAD を v6 に更新 githu…

PINTO_model_zoo:インスタンスセグメンテーション(470_RHIS)味見👀

インスタンスセグメンテーションです。 特徴的な構造として、このモデルには物体検出部分は含まれないため、自分の好きな物体検出モデルの検出結果と組み合わせて使用します。そのため、このモデルの入力は、画像とROIの2入力です セグメンテーション結果は…

LFM2-VL を Colaboratory でお試し🦔

LFM2-VL をお試ししています軽量なVLMです。CPUでも多少時間かかりますが動作します。ただし、ライセンスがちょっと独特なので、状況によっては仕事とかだと使いにくいかも。 LFM2-VL を味見しているかなり軽量(450M、1.6B)でCPU推論も何とか動くっぽい。…

SmolVLM2 を Colaboratory でお試し🦔

SmolVLM2の味見をしています比較的軽量(256M、500M、2.2B)なVLMですが、Flash Attention2 必須のため、Ampere GPU以上(L4以上)が必要です。 SmolVLM2の推論味見と、ファインチューニング味見をしているただ、ファインチューニングの確認に使っている医療…

Audio-Processing-Node-Editor v0.3.1 をリリースしました👀

いや、リリース自体は先週には実施していたのですが、、、書き忘れていました。 以下を追加しています。僕が趣味で欲しい機能や、仕事で欲しかった機能を追加しています。 Zeroノード追加 ループバック(Windows)ノード追加 Videoノードを高速化 上記みたい…

Audio-Processing-Node-Editor に ReSpeaker v2 ノードを追加🎤

実は仕事ではちょいちょい縁のあるReSpeakerさんですいくつかの現場で遭遇しています。大体の場合は「あまり高価ではないデバイスで上手いこと音声認識したい」みたいな状況ですが 仕事で検証した内容を、表にアウトプットするのも微妙な現場で触ることが多…

Image-Processing-Node-Editor v0.5.0、Audio-Processing-Node-Editor v0.2.0 をリリースしました👀

久々に、Image-Processing-Node-Editor をリリースしました更新内容は、HSVノード追加、セピアノード追加、バグ修正、Windows exe更新。です。 ついでに、Audio-Processing-Node-Editor もリリースしました。既にv0.2.0になっていますが、扱いは初回リリース…

Gemini-2.5-Flash の物体検出・セグメンテーションをAPIでお試し🦔

Gemini-2.5 で物体検出が対応したと聞いたので、ColaboratoryでAPIを試してみています Gemini-2.5-Flash で 物体検出とセグメンテーション味見している物体検出はFlorence-2と同等かちょっと悪い?プロンプトの柔軟性はGemini(2枚目のプロンプトは”Find the…

Voxtral-Mini-3B の文字起こしを Colaboratory でお試し🦔

Voxtral-Mini-3B を味見しています3Bでありながら、それなりのチャット性能を持ち、テキスト+オーディオへの回答や、文字起こしなども出来るモデルです。3Bの他に24Bも公開されていますが、fp16でGPU RAMが55GB必要らしいので、僕の扱える環境では動かすこ…

Gemini CLI で Image-Processing-Node-Editor と Audio-Processing-Node-Editor のノードを作成🦔

Claude Code は 会社のお金で試すので、趣味開発ではGemini CLI を試してみています ミニゲーム作成を試すのも良いのですが、今回は Image-Processing-Node-Editor と Audio-Processing-Node-Editor の ノード追加をまかせてみました 以下は、Gemini CLI に…

Gemini CLI で ミニゲーム作成を試しています🦔

個人的なお話ですが、ちょっと本業だと、オプトアウトの問題とか、AIが苦手な分野?なのか上手くコードが作れない。とかで、CLAUDE CODEとかGemini CLIをイマイチ上手く活用できていませんでした 今回は、個人的な趣味でミニゲームやツールなどをいくつか作…

GLM-4.1V-9B-Thinking を Colaboratory でお試し🦔

GLM-4.1V-9B-Thinking を味見しています👀 GLM-4.1V-9B-Thinking 味見している👀<think>てタグと、<answer>ってタグが推論結果にある pic.twitter.com/lQKSI9hkr7 — 高橋 かずひと@パワポLT職人 (@KzhtTkhs) 2025年7月5日 著者曰く、9Bというモデルサイズでありながら、18のベン</answer></think>…

FastVLM を Colaboratory でお試し🦔

AppleのFastVLMを味見しています出力トークン数が少なくなるようにすれば、それなりに早いです。 試してから気付いたのですが、Apple独自ライセンスのため、正直使いにくいと思います。 FastVLMを味見アウトプットを短くすれば、そこそこ早い pic.twitter.co…

Zenn:【Android】Chaquopy で Python OpenCVを動かしてカメラ表示📷

Chaquopyは、AndroidアプリにPythonを組み込めるようにする開発ツールですカメラ画像を取得してOpenCVを動かしてみました。 Zenn投稿用。Chaquopy を用いて Android 上で Python OpenCV カメラのテスト pic.twitter.com/YTHOTA0XlP — 高橋 かずひと@パワポLT…

alltracker を Colaboratoryでお試し🦔

Dense Point Tracking の alltracker を味見しています追跡性能はかなり高いと思います。が、GPU RAMはがっつり食います alltracker味見している精度は良いと思うんだけど、GPU RAM食うなーこれ。。。 pic.twitter.com/RxUZtv9nyg — 高橋 かずひと@パワポLT…

EdgeTAM のオブジェクトトラッキングを味見👀

今回は、試した結果のみでソースコードとかノートブックの共有は無いです EdgeTAM を Colaboratory で味見しているまあ、サンプル動画はうまくいくよね pic.twitter.com/3wK4xKbOn8 — 高橋 かずひと@パワポLT職人 (@KzhtTkhs) 2025年6月21日 EdgeTAM いじめ…

Kimi-VL を Colaboratory でお試し🦔

Kimi-VLを味見しています精度は良いのでしょうけど、、、試した例では、L4 GPUで推論が3分かかって、ちょっと重い感じするなー Kimi-VL味見Q.What is the dome building in the picture? Think step by step(写真のドーム型の建物は何でしょうか?段階的に…