マルチモーダル
-
- その他 (国内)
- マルチモーダル大規模言語モデルを用いた音楽感情回帰の性能調査
- 蓮実 拓也, ウェリ ナプタリ
- 日本音響学会 2026年秋季研究発表会 (ASJ 2026 autumn)
- 2026.9.9
-
- ワークショップ (国内)
- 相対的に固有な変換特徴の言語化による自然言語クエリからの画風変換LoRAモデル検索
- 金田 悠路 (静岡大学), 杉田 大知 (静岡大学), 大江 優真 (静岡大学), ファム フーロン (筑波大学), 加藤 誠 (筑波大学), 大島 裕明 (兵庫県立大学), 藤田 澄男, 莊司 慶行 (静岡大学)
- WebDB夏のワークショップ2026 情報処理学会 第183回 データベースとデータサイエンス研究会 (SIG-DBS) 情報処理学会 第164回 情報基礎とアクセス技術研究会 (SIG-IFAT) 電子情報通信学会 データ工学研究会 (DE) 合同研究会 (WebDB Workshop 2026)
- 2026.9.8
-
- 論文誌 (国際)
- Exploring Motion-Text Matching for Motion Generation and Editing
- Qing Yu, Kent Fujiwara
- IEEE Transactions on Circuits and Systems for Video Technology
(TCSVT)
- 2026.8.17
-
- カンファレンス (国際)
- Is Feedback All You Need? Benchmarking Random Search vs. Iterative Refinement for Parametric Icon Design
- Naoki Kimura
- The 31st International Conference on Intelligent User Interfaces (ACM IUI 2026)
- 2026.7.16
-
- カンファレンス (国際)
- Retrieval of LoRA Models based on Layer-Wise Weight Embedding without Metadata
- Yuro Kanada (Shizuoka University), Yuma Oe (Shizuoka University), Huu-Long Pham (University of Tsukuba), Makoto P. Kato (University of Tsukuba), Hiroaki Ohshima (University of Hyogo), Sumio Fujita, Yoshiyuki Shoji (Shizuoka University)
- The 16th ACM International Conference on Multimedia Retrieval (ICMR 2026)
- 2026.6.15
-
- カンファレンス (国際)
- Which LoRA Should Be Merged Next? Retrieving an Additional LoRA from a Target Image
- Daichi Sugita (Shizuoka University), Huu-Long Pham (University of Hyogo), Makoto P. Kato (University of Tsukuba), Hiroaki Ohshima (University of Hyogo), Sumio Fujita, Yoshiyuki Shoji (Shizuoka University)
- The 16th ACM International Conference on Multimedia Retrieval (ICMR 2026)
- 2026.6.15
-
- カンファレンス (国際)
- Causal Motion Diffusion Models for Autoregressive Motion Generation
- Qing Yu, Akihisa Watanabe (Waseda University), Kent Fujiwara
- The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)
- 2026.6.7
-
- カンファレンス (国際)
- ProjFlow: Projection Sampling with Flow Matching for Zero‑Shot Exact Spatial Motion Control
- Akihisa Watanabe (Waseda University), Qing Yu, Edgar Simo-Serra (Waseda University), Kent Fujiwara
- The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)
- 2026.6.5
-
- その他 (国内)
- 楽曲の文脈情報理解に向けたマルチモーダル大規模言語モデルによる楽曲同定能力の検討
- 竹本 健悟 (LINEヤフー株式会社/東京大学), 蓮実 拓也, Welly Naptali, 和気 雅弥, 橘 健太郎
- 音学シンポジウム 2026 (第146回音楽情報科学・第160回音声言語情報処理合同研究発表会)
- 2026.6.5
-
- カンファレンス (国際)
- CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
- Hokuto Munakata, Takehiro Imamura (Nagoya University), Taichi Nishimura, Tatsuya Komatsu
- 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2026)
- 2026.5.6
-
- カンファレンス (国内)
- ニューラルオーディオコーデック特徴量を用いた音声から話者特有の表情予測モデルの構築及び分析
- 朴 浚鎔 (東京大学), 陳 晋升 (東京大学), 土井 啓成, 朴 炳宣, 白旗 悠真, 橘 健太郎, 楊 棟 (東京大学), 齋藤 佑樹 (東京大学), 猿渡 洋 (東京大学)
- 日本音響学会 2026年春季研究発表会 (ASJ 2026 spring)
- 2026.3.19
-
- カンファレンス (国際)
- Shape-N-Motion: Fine-Grained Hand Object Manipulation Recognition with Ultrasonic and IMU
- Kaito Fujishige (Institute of Science Tokyo), Kota Tsubouchi, Yuuki Nishiyama (The University of Tokyo), Masamichi Shimosaka (Institute of Science Tokyo)
- The 24th International Conference on Pervasive Computing and Communications (PerCom 2026)
- 2026.3.17
-
- ワークショップ (国際)
- CAVIARES: Corpus for Audio-Visual Expressive Voice Agent
- Jinsheng Chen (The University of Tokyo), Yuki Saito (The University of Tokyo), Dong Yang (The University of Tokyo), Naoko Tanji (The University of Tokyo), Hironori Doi, Byeongseon Park, Yuma Shirahata, Kentaro Tachibana, Hiroshi Saruwatari (The University of Tokyo)
- 2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2025)
- 2025.12.9
-
- その他 (国際)
- CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
- Hokuto Munakata, Takehiro Imamura (Nagoya University), Taichi Nishimura, Tatsuya Komatsu
- arXiv.org (arXiv)
- 2025.11.19
-
- カンファレンス (国際)
- DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds
- Takuya Hasumi, Yusuke Fujita
- The 26th Annual Conference of the International Speech Communication Association (INTERSPEECH 2025)
- 2025.8.21
-
- カンファレンス (国際)
- Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
- Yuchi Ishikawa, Shota Nakada, Hokuto Munakata, Kazuhiro Saito, Tatsuya Komatsu, Yoshimitsu Aoki (Keio University)
- The 26th Annual Conference of the International Speech Communication Association (INTERSPEECH 2025)
- 2025.8.19
-
- カンファレンス (国際)
- Leveraging Unlabeled Audio for Audio-Text Contrastive Learning via Audio-Composed Text Features
- Tatsuya Komatsu, Hokuto Munakata, Yuchi Ishikawa
- The 26th Annual Conference of the International Speech Communication Association (INTERSPEECH 2025)
- 2025.8.17
-
- 論文誌 (国際)
- A-UVI: GNSS-Assisted EO-based UV Index Estimation Method for Individual-level Precise UV Exposure Assessment
- Yuuki Nishiyama (The University of Tokyo), Subaru Atsumi (The University of Tokyo), Kota Tsubouchi, Kaoru Sezaki (The University of Tokyo)
- The Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies (IMWUT)
- 2025.6.25
-
- カンファレンス (国際)
- Language-based Audio Moment Retrieval
- Hokuto Munakata, Taichi Nishimura, Shota Nakada, Tatsuya Komatsu
- 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2025)
- 2025.4.11
-
- カンファレンス (国際)
- Music Tagging with Classifier Group Chains
- Takuya Hasumi, Tatsuya Komatsu, Yusuke Fujita
- 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2025)
- 2025.4.10