Tried running compact models via WASM. The result: surprisingly usable latency for note-taking and keyword jogs.
Lesson: if it can run client-side, let it.