Zero-Fi: Zero-Shot Wi-Fi-Based Human Activity Recognition via Contrastive Signal-Language Alignment
Quick Answer
Zero-Fi introduces a novel framework for zero-shot Wi-Fi-based human activity recognition by aligning Wi-Fi signal features with natural-language descriptions.
Quick Take
This approach enables the recognition of unseen activities without requiring labeled samples, demonstrating effective performance on large-scale benchmark datasets.
Key Points
- Zero-Fi utilizes contrastive signal-language alignment for activity recognition.
- It recognizes new activities without labeled Wi-Fi samples or model adaptation.
- The framework shows effective zero-shot recognition on public benchmark datasets.
- This method extends Wi-Fi sensing beyond predefined activity classes.
- Significant advancements in human activity recognition are achieved with Zero-Fi.
Paper Resources
📖 Reader Mode
~2 min readAbstract:Wi-Fi-based human activity recognition has advanced substantially, but most existing methods assume a closed set of activities and require labeled Wi-Fi samples for every target class, limiting their ability to recognize unseen activities. We present Zero-Fi, a contrastive signal-language alignment framework for zero-shot Wi-Fi-based human activity recognition. Zero-Fi learns unified representations from complementary Wi-Fi signal features and aligns them with the semantic representations of natural-language activity descriptions in a shared embedding space. This cross-modal alignment enables Zero-Fi to recognize new activity classes without requiring labeled Wi-Fi samples or model adaptation for those classes. Experiments on large-scale public benchmark datasets demonstrate effective zero-shot recognition of held-out activity classes, highlighting the potential of signal-language alignment to extend Wi-Fi sensing beyond predefined activity classes.
| Subjects: | Computer Vision and Pattern Recognition (cs.CV); Artificial Intelligence (cs.AI) |
| Cite as: | arXiv:2607.26381 [cs.CV] |
| (or arXiv:2607.26381v1 [cs.CV] for this version) | |
| https://doi.org/10.48550/arXiv.2607.26381 arXiv-issued DOI via DataCite (pending registration) |
Submission history
From: Yili Ren [view email]
[v1]
Wed, 29 Jul 2026 01:34:02 UTC (6,486 KB)
— Originally published at arxiv.org
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from arXiv cs.CV
See more →ProMoE-FL: Prototype-conditioned Mixture of Experts for Multimodal Federated Learning with Missing Modalities
ProMoE-FL introduces a Prototype-conditioned Mixture-of-Experts framework for multimodal federated learning, effectively addressing missing modalities. It outperforms existing methods on four chest X-ray datasets, demonstrating superior feature synthesis capabilities in both homogeneous and heterogeneous settings.