A multimodal voice companion creates an awkward product tension: users want to ask “What am I looking at? ” without granting an AI system indefinite access to their camera. The easiest implementation—forwarding frames continuously—also creates hidden costs.
Source: [Dev.to](https://dev.to/susiewang/dont-send-the-whole-camera-build-one-shot-visual-context-for-a-tencent-rtc-voice-companion-4mnj)