* `sort4x16lo $mDst0, $mSrc0, $mSrc1`
* `sort4x16lo $aDst0, $aSrc0, $aSrc1`
* `sort4x16lo $aDst0, $aSrc0:BU, $aSrc1`

Perform SIMD *sort* permutation on 4 x 16-bit values, across 2 source
registers, producing a 2 x 16-bit result.
