arxivcs.CV2026-07-31
On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models
3D point cloud-language models (3D-LLMs) enable 3D understanding by pairing point cloud encoders with large language models, but existing methods rely on costly multi-modal encoders (e.g., ULIP-2) that require image-text-point cloud alignment on 8x A100-scale compute, creating hi…