compare large csv files using an identity column to locate missing rows, duplicates, and data mismatches