


default search action
27th ISM 2025: Naples, Italy
- International Symposium on Multimedia, ISM 2025, Naples, Italy, December 8-10, 2025. IEEE 2025, ISBN 979-8-3315-4590-1

- Yuki Ryu, Akira Kubota:

Facial Similarity-Guided Fine-Tuning for Hand Shape Correction in AI-Generated Human Images. 1 - Cem Eteke

, Alexander Griessel, Wolfgang Kellerer, Eckehard G. Steinbach:
High-Fidelity Semantic Video Communication with Controllable Image-To-Video Diffusion Models. 1-5 - Fumiya Higashide, Akira Kubota:

Diversity-Aware Active Learning for Object Detection Utilizing Time-of-Day Metadata. 2 - Naoki Nishiya, Akira Kubota:

LPConv: Laplacian Pyramid Convolutions for Parameter-Efficient Receptive Field Expansion. 3 - William Menz, Ralf Dittrich, Rakesh Rao Ramachandra Rao, Steve Göring, Alexander Raake:

Smarter Traps: Neural Network-Driven Classification of Small Mammals. 4 - Giancarlo Sperlí

:
Exploring Privacy and Security Risks in LLMs: Data Leakage, Prompt Injection, and Membership Inference. 5-12 - Takayuki Nakachi, Park Cheolhwan, Yasuhisa Kato, Mitsuru Maruyama:

DWT Domain Precinct-Wise Scrambling for Encryption-then-Compression with JPEG XS. 13-16 - Giulia Di Flamminio, Fabio Persia, Daniela D'Auria, Ciro Esposito, Vincenzo Coppola:

Machine Learning Techniques for the Diagnosis and Monitoring of Nevi and Melanomas. 17-20 - Onhi Kato, Akira Kubota:

Fewer-Shot Self-Supervised Image Recoloring for Deutan Deficiency Based on Laplacian Pyramid. 21-22 - Mohammadreza Ghafari, Thibault Cholez

, Olivier Festor:
QoE Evaluation of BPP Packet Wash Using ROI-Based Scalable Video Coding. 23-30 - Yohei Sakai, Tomokazu Ishikawa:

Evaluation of AR-Based Blind Spot Monitoring Across Diverse Driving Scenarios Using a VR Simulator. 31-38 - Selin Nur Özsert

, Daniel Rodriguez-Guevara, Leonardo Franco, Wenxuan Wei, Eckehard G. Steinbach, Domenico Prattichizzo:
A Forearm-Worn Haptic Device for Integrated Tactile and Kinaesthetic Feedback via Skin Stretch. 39-45 - Maren Schnieder

, Ana Isabel Canhoto
, Ramin Behbehani
, Ahmad Beltagui
, Niraj Kumar
, Amirreza Alizamani:
Prompted Vs. Organic Customer Insight: Comparing the Value of Focus Groups and Online Reviews in Product and Service Innovation. 46-53 - Yingen Xiong, Christopher Peri:

Low-Light Image Enhancement with Adaptive Brightness Transform Models for Video See-Through AR. 54-55 - Haruhiko Murata, Naoki Minamino, Takashi Ueda, Yohei Kondo, Kazuhiro Hotta:

Video Classification of Marchantia Polymorpha Using a Video Vision Transformer with Emphasized Channel Information. 56-59 - Sotaro Shiozawa, Akira Kubota:

Syntax-Aware Transformer for Sentiment Analysis of Japanese SNS Text. 60-63 - Patrice Rondao Alface, Lauri Ilola, Lukasz Kondrad:

Coding Gaussian Splat Scenes with V3C/V-PCC. 64-68 - Yuki Yanai, Tomokazu Ishikawa:

Comparative Evaluation of Deep Learning Methods for Wood Surface Defect Detection: A Comprehensive Study of Semantic Segmentation Approaches. 69-72 - Steve Göring, Rakesh Rao Ramachandra Rao, Alexander Raake:

Exploiting LLMs for Metadata-Based Video Quality Prediction. 73-74 - Hayato Tsukada, Akira Kubota:

Lightweight High-Accuracy Tomato Detection and Classification by Efficientnet-Enhanced YOLOv8. 75 - William Menz, Alexander Zoubarev, David Kutschke, Rakesh Rao Ramachandra Rao, Louay Bassbouss, Sven Bliedung von der Heide, Steve Göring, Alexander Raake:

Evaluation of a Floating-Head Communication Prototype for Video-Conferencing. 76 - HyungWoo Kang, YeoJun Yoon, Joong-Hwan Baek, Byung Tae Oh:

Rendering Compressed Point Clouds with a Voxel-Based Method. 77 - Lukasz Gasiorowski, Jagoda Lazarek, Sebastian Purtak, Pawel Góra:

Application of Computer Vision Research (ISVP.AI) in the Development of the Comprehensive Stellis One Platform for Sports Organizations. 78 - Satoki Hidaka, Kazuhiro Hotta:

Recognition of Pitching Habits Using Multimodal Data of RGB Video and Skeleton. 79-82 - Viviana Crescitelli:

Layout-Aware Self-Correcting Prompts for Multimodal LLM Parking Lot Monitoring. 83-86 - Lukasz Grzymkowski, Tomasz P. Stefanski:

Comparative Analysis of Face Recognition Models: Runtime Environments and Compute Units on Edge. 87-90 - Gian Marco Orlando, Marco Perillo

, Diego Russo, Vincenzo Moscato:
An Agent-Driven Architecture for Harmful Meme Detection through Multimodal Decomposition. 91-97 - Ahmadreza Sezavar, Catarina Brites

, João Ascenso:
Attention-Enhanced Multi-Branch Spiking Neural Network for Event Stream Super-Resolution. 98-102 - Mariano Barone, Francesco Di Serio, Vincenzo Moscato, Marco Postiglione, Giuseppe Riccio, Antonio Romano:

SynthMed: Generating and Detecting Multimodal Deepfakes for Healthcare Communication. 108-115 - Mohammad Waquas Usmani

, Sankalpa Timilsina, Michael Zink, Susmit Shannigrahi:
Secure AI-Driven Super-Resolution for Real-Time Mixed Reality Applications. 116-123 - Misha Libman, Gelareh Mohammadi:

Personalised Stress Detection: An Exploration of Temporal Multimodal Late Fusion Strategies. 124-132 - Peter O. Fasogbon:

Extrinsic Calibration of RGB-D Cameras Using Depth Refinement. 133-140 - Khoa Dang Pham, Farhad Pakdaman, Honglei Zhang, Hamed Rezazadegan Tavakoli, Nam Le

, Jukka I. Ahonen, Moncef Gabbouj
:
Evaluating the Emerging MPEG Video Coding for Machines in Semantic Segmentation. 141-148 - Francesco Pistolesi, Matteo Mugnai, Beatrice Lazzerini:

Adaptive Obfuscation for Reusing RGB Datasets for Privacy-Preserving Human Pose Estimation. 149-155 - Aoi Ito, Katunobu Itou:

Dialogue-Pseudo: A Speaker Pseudonymization Framework for Privacy Protection in Dialogue Speech Data. 156-163 - Reza Hedayati, Mea Wang, Logan Rakai:

Opt360: QoE Optimization for 360° Video Streaming. 164-171 - Michele Baldassini, Francesco Pistolesi, Beatrice Lazzerini:

Foot-Strike Pattern Recognition from Inertial Data with Machine Learning. 172-179 - Francesco Pistolesi, Michele Baldassini, Matteo Mugnai, Beatrice Lazzerini:

The Sustainability Card: Measuring Sustainability of Multimedia AI Models. 180-181 - Sarah Kaißer, Markus Kleffmann, Kristina Schaaff:

One Size Doesn't Fit All: Age-Aware Gamification Mechanics for Multimedia Learning Environments. 182-189 - Florian Schimanke, Robert Mertens, Felix Prankel:

An Influence Analysis of Hybrid Lectures with a Simple Setup on the Student Experience. 190-195 - Suryaprakash Reddy Kalvakolu, Heinrich Söbke, Florian Wehking, Mukesh Chandra Kumar Mamidala, Eckhard Kraft:

RAG Chatbots for Educational Virtual Field Trips. 196-201 - Lei Gao, Kai Liu, Kevin Tang, Ling Guan:

An Efficient Optimization Criterion for Multi-View Feature Representation Learning. 202-207 - Antonio Laudante, Mariano Barone, Giuseppe Riccio, Antonio Romano, Francesco Di Serio, Antonio Scialdone, Francesco Porciello, Nicola Rainone, Vincenzo Moscato:

AMICO: A Semantic and Multimodal Framework for AI-Assisted Clinical Reporting. 208-213 - Mohsina Bilal, G. Gopakumar

:
Empowering Access to Public Services: An Analysis on Multimodal, Retrieval-Augmented Chatbots for Indic Language Support to Farmers. 214-217 - Cristovão Pessoa Cândido Neto, Cláudio de Souza Baptista, André Luiz Firmino Alves, Vivek Swarnakar, Anselmo Cardoso de Paiva:

Analysis of Multimodal LLMs in VQA in the Field of Radiology. 218-225 - Milena M. Adão, Silvio Jamil Ferzoli Guimarães, Zenilton Kleber G. do Patrocínio Jr.

:
Extending Visual Dialog Beyond English: An Analysis of Monolingual and Multilingual Models. 226-233 - H. Burak Dogaroglu, Hongjie You, Atanas Boev, Elena Alshina, Eckehard G. Steinbach:

On the Suitability of Perceptual Quality Metrics for Learning-Based Screen Content Compression. 234-237 - Ibrahim Tinas, Yavuz Selim Bostanci, Müjdat Soytürk:

Multiscale RGB-Thermal Fusion for Vulnerable Road User Detection with ScaleFuse. 238-243 - Mohammad Moradi, Morteza Moradi, Marco Grassia, Giuseppe Mangioni:

Graph-Based Evaluation of Visual Brain Decoding from fMRI Data. 244-251 - Abdul Bhutta, Naimul Khan, Ling Guan:

CCAFF: Object Tracking Under Heavy Occlusion. 252-257 - Sharmilee Rajkumar Rajan, Ming-Ching Chang, Pradeep K. Atrey:

Physics-Guided Exposure Parameter Estimation for Image Metadata Verification. 258-262 - Ole Kristian Rustebakke, Mehdi Houshmand Sarkhoosh, Cise Midoglu, Pål Halvorsen:

Extracting Player Speed from Football Videos. 266-273 - Mehdi Houshmand Sarkhoosh, Frøy Øye, Henrik Nestor Sørlie, Nam Hoang Vu, Dag Johansen, Cise Midoglu, Tomas Kupka, Pål Halvorsen:

ExposureEngine: Oriented Logo Detection and Sponsor Visibility Analytics in Sports Broadcasts. 274-279 - Lipisha Chaudhary, Trisha Mittal, Subhadra Gopalakrishnan, Ifeoma Nwogu, Jaclyn Pytlarz:

MCAD: Multimodal Context-Aware Audio Description Generation for Soccer. 280-287 - Numan Zafar

, Priyo Ranjan Kundu Prosun, Shafique Ahmad Chaudhry:
Knowledge-Based Behavioral Biometrics for Secure Authentication in Virtual Reality. 288-291 - Gerald Friedland, Robert Mertens:

From 2D to 3D: How Discrete Dependencies Enable Cross-Dimensional Inference in Neural Networks in Defiance of Euclidean Geometry. 292-299 - Irien Akter, Vivek K. Singh, Pradeep K. Atrey:

Forecasting "Neg Storms": Time-Aware Modeling of Toxic Situations in Social Media. 300-307 - Florian Eggenkemper, Jana Swerew, Teresa Rehers, Manuel Hanhoff, Constantin A. Rothkopf, Robert Mertens:

Personalized Adaptive Magnification in Gaze-Based Interaction. 308-314 - Javier Iglesias, Juan Felipe Mogollón, Iñigo Tamayo, Zaloa Fernández, Olov Danielsson, Ivan Pretel, Asier Lopez:

Adaptation of CDN at the Edge Using Cloud-Native Network Telemetry Across Media Scenarios. 315-322 - Duc V. Nguyen, Nguyen Thi Quynh Ly, Truong Thu Huong:

Quality Assessment of Dynamic 3D Model in Virtual Reality: Effects of Level of Detail and Viewing Distance. 323-326 - Serhan Gül, Igor D. D. Curcio:

3GPP PDU Set Framework: Release 19 Updates. 327-330 - Moses Omondi, Yassine Belkhouche:

A One-Class Structural Similarity-Based Autoencoder for the Detection of Malaria-Infected Cells. 331-335 - Reema Maheshbhai Gadhia, Nasim Hajari:

Comparison of Multimodal Fall Detection Strategies. 336-339 - Rehab K. Qarout, Joud Y. Samkari, Rahaf M. ALFudhayl, Ruba H. ALSulami, Shada M. Basudan, Ghadi K. AlJuhani, Nuha Zamzami:

Emotion Detection and Classification of Different Saudi Dialects. 340-345 - Fernando Boronat, Lluc Simó, Rubén Prieto, Almanzor Sapena:

AR in HbbTV-Based Hybrid TV Services. 346-353 - Kadir Torun

, Mustafa Sert
:
A Hybrid Noise Perturbation-Based Denoising Autoencoder for Machine Sound Anomaly Detection. 354-357 - Akram Ansari, S. Ali John Naqvi

, Mea Wang, Emir Halepovic:
A First Look at Open-GoP Streaming with Av1 S-Frames. 358-365 - Hamed R. Tavakoli, Homayun Afrabadpey:

On Progressive Compressed Neural Model Storage. 366-369 - Alperen F. Zengin, Ekrem Çetinkaya, Ali C. Begen, Saba Ahsan, Serhan Gül, Kashyap Kammachi Sreedhar, Emre Aksu:

Metadata-Guided Hot Swapping of Specialized Super-Resolution Models in Streaming Systems. 370-374 - Hadi Heidarirad, Amir Allahveran, Mea Wang:

TARS: Temporal-Spatial Adaptation for Volumetric Video Streaming. 375-382 - Yuriy A. Reznik:

Cost-Optimal Design of Hybrid Broadcast - Unicast Video Delivery Systems. 383-389

manage site settings
To protect your privacy, all features that rely on external API calls from your browser are turned off by default. You need to opt-in for them to become active. All settings here will be stored as cookies with your web browser. For more information see our F.A.Q.


Google
Google Scholar
Semantic Scholar
Internet Archive Scholar
CiteSeerX
ORCID













