Organizing Unstructured Image Collections using Natural Language

Liu, Mingxuan; Zhong, Zhun; Li, Jun; Franchi, Gianni; Roy, Subhankar; Ricci, Elisa

Computer Science > Computer Vision and Pattern Recognition

arXiv:2410.05217 (cs)

[Submitted on 7 Oct 2024 (v1), last revised 14 Oct 2024 (this version, v2)]

Title:Organizing Unstructured Image Collections using Natural Language

Authors:Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci

View PDF HTML (experimental)

Abstract:Organizing unstructured visual data into semantic clusters is a key challenge in computer vision. Traditional deep clustering (DC) approaches focus on a single partition of data, while multiple clustering (MC) methods address this limitation by uncovering distinct clustering solutions. The rise of large language models (LLMs) and multimodal LLMs (MLLMs) has enhanced MC by allowing users to define clustering criteria in natural language. However, manually specifying criteria for large datasets is impractical. In this work, we introduce the task Semantic Multiple Clustering (SMC) that aims to automatically discover clustering criteria from large image collections, uncovering interpretable substructures without requiring human input. Our framework, Text Driven Semantic Multiple Clustering (TeDeSC), uses text as a proxy to concurrently reason over large image collections, discover partitioning criteria, expressed in natural language, and reveal semantic substructures. To evaluate TeDeSC, we introduce the COCO-4c and Food-4c benchmarks, each containing four grouping criteria and ground-truth annotations. We apply TeDeSC to various applications, such as discovering biases and analyzing social media image popularity, demonstrating its utility as a tool for automatically organizing image collections and revealing novel insights.

Comments:	Preprint. Project webpage: this https URL
Subjects:	Computer Vision and Pattern Recognition (cs.CV)
Cite as:	arXiv:2410.05217 [cs.CV]
	(or arXiv:2410.05217v2 [cs.CV] for this version)
	https://doi.org/10.48550/arXiv.2410.05217

Submission history

From: Mingxuan Liu [view email]
[v1] Mon, 7 Oct 2024 17:21:46 UTC (28,798 KB)
[v2] Mon, 14 Oct 2024 18:47:46 UTC (28,797 KB)

Computer Science > Computer Vision and Pattern Recognition

Title:Organizing Unstructured Image Collections using Natural Language

Submission history

Access Paper:

References & Citations

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators

Computer Science > Computer Vision and Pattern Recognition

Title:Organizing Unstructured Image Collections using Natural Language

Submission history

Access Paper:

References & Citations

BibTeX formatted citation

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators