	.version 1.4
	.target sm_11, map_f64_to_f32
	// compiled with ../../../External/3rdParty/NVIDIA/CUDA/win/64/bin64/../open64/lib//be.exe
	// nvopencc 2.3 built on 2009-07-14

	//-----------------------------------------------------------
	// Compiling C:\Users\dvaeng\AppData\Local\Temp/tmpxft_0001d5dc_00000000-9_LumaCurve.cpp3.i (C:/Users/dvaeng/AppData/Local/Temp/ccBI#.a21512)
	//-----------------------------------------------------------

	//-----------------------------------------------------------
	// Options:
	//-----------------------------------------------------------
	//  Target:ptx, ISA:sm_11, Endian:little, Pointer Size:64
	//  -O3	(Optimization level)
	//  -g0	(Debug level)
	//  -m2	(Report advisories)
	//-----------------------------------------------------------

	.file	1	"C:\Users\dvaeng\AppData\Local\Temp/tmpxft_0001d5dc_00000000-8_LumaCurve.cudafe2.gpu"
	.file	2	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/PixelRGB.h"
	.file	3	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/PixelYUV.h"
	.file	4	"C:\Program Files (x86)\Microsoft Visual Studio 9.0\VC\include\crtdefs.h"
	.file	5	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\crt/device_runtime.h"
	.file	6	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\host_defines.h"
	.file	7	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\builtin_types.h"
	.file	8	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\device_types.h"
	.file	9	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\driver_types.h"
	.file	10	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\texture_types.h"
	.file	11	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\vector_types.h"
	.file	12	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\host_defines.h"
	.file	13	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\device_launch_parameters.h"
	.file	14	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\crt\storage_class.h"
	.file	15	"C:\Program Files (x86)\Microsoft Visual Studio 9.0\VC\include\time.h"
	.file	16	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/Utils.h"
	.file	17	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/VectorUtils.h"
	.file	18	"c:\scully64\shared\adobe\MediaCore\Display\Inc\CUDA/Effects/ColorCorrector_Curves.h"
	.file	19	"c:/scully64/shared/adobe/MediaCore/Display/Src/CUDA/Effects/LumaCurve.cu"
	.file	20	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/Numeric.h"
	.file	21	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\common_functions.h"
	.file	22	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\crt/func_macro.h"
	.file	23	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_functions.h"
	.file	24	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\device_functions.h"
	.file	25	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_constants.h"
	.file	26	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_11_atomic_functions.h"
	.file	27	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_12_atomic_functions.h"
	.file	28	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_13_double_functions.h"
	.file	29	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\common_types.h"
	.file	30	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\texture_fetch_functions.h"
	.file	31	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_functions_dbl_ptx1.h"
	.file	32	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/ColorSpaceConvert.h"

	.shared .align 4 .b8 u__0[64];
	.shared .align 4 .b8 sPointsX__2[64];
	.shared .align 4 .b8 sPointsY__3[64];
	.shared .align 4 .b8 sPointsY2__4[64];
	.shared .s32 sPointCount__1;
	.const .align 4 .b8 kRGB32f_To_601YPbPr[36] = {135,22,153,62,162,69,22,63,213,120,233,61,33,201,44,190,111,155,169,190,0,0,0,63,0,0,0,63,70,94,214,190,232,134,166,189};
	.const .align 4 .b8 k601YPbPr_To_RGB32f[36] = {0,0,128,63,0,0,0,0,188,116,179,63,0,0,128,63,152,50,176,190,158,209,54,191,0,0,128,63,229,208,226,63,0,0,0,0};
	.const .align 4 .b8 kRGB32f_To_601YCbCr[36] = {70,246,130,66,145,141,0,67,94,186,199,65,33,48,23,194,240,103,148,194,0,0,224,66,0,0,224,66,111,146,187,194,70,182,145,193};
	.const .align 4 .b8 k601YCbCr_To_RGB32f[36] = {37,160,149,59,0,0,0,0,182,23,205,59,37,160,149,59,40,15,201,186,156,239,80,187,37,160,149,59,236,155,1,60,0,0,0,0};
	.const .align 4 .b8 kRGB8u_To_601YCbCr[36] = {219,121,131,62,152,14,1,63,18,131,200,61,174,199,23,190,238,252,148,190,197,224,224,62,197,224,224,62,217,78,188,190,174,71,146,189};
	.const .align 4 .b8 k601YCbCr_To_RGB8u[36] = {127,10,149,63,0,0,0,0,160,74,204,63,127,10,149,63,254,148,200,190,184,30,80,191,127,10,149,63,78,26,1,64,0,0,0,0};
	.const .align 4 .b8 kRGB32f_To_709YPbPr[36] = {208,179,89,62,89,23,55,63,152,221,147,61,186,164,234,189,210,86,197,190,0,0,0,63,0,0,0,63,190,134,232,190,16,202,59,189};
	.const .align 4 .b8 k709YPbPr_To_RGB32f[36] = {0,0,128,63,0,0,0,0,12,147,201,63,0,0,128,63,221,209,63,190,243,173,239,190,0,0,128,63,77,132,237,63,0,0,0,0};
	.const .align 4 .b8 kRGB32f_To_709YCbCr[36] = {106,60,58,66,6,161,28,67,244,253,124,65,223,79,205,193,8,172,172,194,0,0,224,66,0,0,224,66,195,117,203,194,236,81,36,193};
	.const .align 4 .b8 k709YCbCr_To_RGB32f[36] = {37,160,149,59,0,0,0,0,239,94,230,59,37,160,149,59,33,57,91,186,178,245,8,187,37,160,149,59,82,185,7,60,0,0,0,0};
	.const .align 4 .b8 kRGB8u_To_709YCbCr[36] = {207,247,58,62,53,62,29,63,231,251,125,61,147,24,206,61,23,89,173,190,197,224,224,62,197,224,224,62,12,66,204,190,195,245,36,189};
	.const .align 4 .b8 k709YCbCr_To_RGB8u[36] = {127,10,149,63,0,0,0,0,147,120,229,63,127,10,149,63,53,94,90,190,205,108,8,191,127,10,149,63,154,49,7,64,0,0,0,0};
	.const .align 4 .b8 k709YCbCr_To_601YCbCr[36] = {0,0,128,63,23,100,203,61,1,77,68,62,0,0,0,0,18,103,125,63,10,158,226,189,0,0,0,0,61,98,148,189,249,191,123,63};
	.const .align 4 .b8 k601YCbCr_To_709YCbCr[36] = {0,0,128,63,122,165,236,189,179,237,84,190,0,0,0,0,204,98,130,63,216,188,234,61,0,0,0,0,74,179,153,61,234,61,131,63};
	.const .align 4 .b8 kYCbCrOffset[12] = {0,0,128,65,0,0,0,67,0,0,0,67};

	.entry LumaCurve_MaskKernel (
		.param .u64 __cudaparm_LumaCurve_MaskKernel_inImage,
		.param .s32 __cudaparm_LumaCurve_MaskKernel_inPitch,
		.param .u64 __cudaparm_LumaCurve_MaskKernel_inSecondaryMask,
		.param .s32 __cudaparm_LumaCurve_MaskKernel_inWidth,
		.param .s32 __cudaparm_LumaCurve_MaskKernel_inHeight)
	{
	.reg .u32 %r<25>;
	.reg .u64 %rd<10>;
	.reg .f32 %f<11>;
	.reg .pred %p<4>;
	.loc	19	145	0
$LBB1_LumaCurve_MaskKernel:
	.loc	19	148	0
	cvt.s32.u16 	%r1, %ctaid.x;
	cvt.s32.u16 	%r2, %ntid.x;
	mul24.lo.s32 	%r3, %r1, %r2;
	cvt.s32.u16 	%r4, %ctaid.y;
	cvt.s32.u16 	%r5, %ntid.y;
	mul24.lo.s32 	%r6, %r4, %r5;
	cvt.u32.u16 	%r7, %tid.x;
	add.u32 	%r8, %r3, %r7;
	cvt.u32.u16 	%r9, %tid.y;
	add.u32 	%r10, %r6, %r9;
	ld.param.s32 	%r11, [__cudaparm_LumaCurve_MaskKernel_inWidth];
	set.gt.u32.s32 	%r12, %r11, %r8;
	neg.s32 	%r13, %r12;
	ld.param.s32 	%r14, [__cudaparm_LumaCurve_MaskKernel_inHeight];
	set.gt.u32.s32 	%r15, %r14, %r10;
	neg.s32 	%r16, %r15;
	and.b32 	%r17, %r13, %r16;
	mov.u32 	%r18, 0;
	setp.eq.s32 	%p1, %r17, %r18;
	@%p1 bra 	$Lt_0_2050;
	.loc	19	151	0
	ld.param.s32 	%r19, [__cudaparm_LumaCurve_MaskKernel_inPitch];
	ld.param.u64 	%rd1, [__cudaparm_LumaCurve_MaskKernel_inSecondaryMask];
	mov.u64 	%rd2, 0;
	setp.eq.u64 	%p2, %rd1, %rd2;
	@%p2 bra 	$Lt_0_2818;
	.loc	16	89	0
	mul24.lo.s32 	%r20, %r10, %r19;
	add.s32 	%r21, %r20, %r8;
	cvt.s64.s32 	%rd3, %r21;
	mul.lo.u64 	%rd4, %rd3, 4;
	add.u64 	%rd5, %rd1, %rd4;
	ld.global.f32 	%f1, [%rd5+0];
	.loc	19	153	0
	mov.f32 	%f2, %f1;
	bra.uni 	$Lt_0_2562;
$Lt_0_2818:
	mov.f32 	%f2, 0f3f800000;     	// 1
	mul24.lo.s32 	%r22, %r10, %r19;
	add.s32 	%r23, %r22, %r8;
	cvt.s64.s32 	%rd3, %r23;
$Lt_0_2562:
	.loc	16	100	0
	ld.param.u64 	%rd6, [__cudaparm_LumaCurve_MaskKernel_inImage];
	mul.lo.u64 	%rd7, %rd3, 16;
	add.u64 	%rd8, %rd6, %rd7;
	ld.const.f32 	%f3, [k601YPbPr_To_RGB32f+24];
	mul.f32 	%f4, %f3, %f2;
	ld.const.f32 	%f5, [k601YPbPr_To_RGB32f+12];
	mul.f32 	%f6, %f5, %f2;
	ld.const.f32 	%f7, [k601YPbPr_To_RGB32f+0];
	mul.f32 	%f8, %f7, %f2;
	mov.f32 	%f9, 0f3f800000;     	// 1
	st.global.v4.f32 	[%rd8+0], {%f4,%f6,%f8,%f9};
$Lt_0_2050:
	.loc	19	160	0
	exit;
$LDWend_LumaCurve_MaskKernel:
	} // LumaCurve_MaskKernel

	.entry LumaCurve_LumaKernel (
		.param .u64 __cudaparm_LumaCurve_LumaKernel_inImage,
		.param .s32 __cudaparm_LumaCurve_LumaKernel_inPitch,
		.param .u64 __cudaparm_LumaCurve_LumaKernel_inSecondaryMask,
		.param .s32 __cudaparm_LumaCurve_LumaKernel_inWidth,
		.param .s32 __cudaparm_LumaCurve_LumaKernel_inHeight,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX0,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX1,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX2,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX3,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX4,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX5,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX6,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX7,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX8,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX9,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX10,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX11,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX12,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX13,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX14,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointX15,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY0,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY1,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY2,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY3,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY4,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY5,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY6,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY7,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY8,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY9,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY10,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY11,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY12,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY13,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY14,
		.param .u8 __cudaparm_LumaCurve_LumaKernel_inPointY15)
	{
	.reg .u32 %r<80>;
	.reg .u64 %rd<50>;
	.reg .f32 %f<196>;
	.reg .pred %p<22>;
	.loc	19	202	0
$LBB1_LumaCurve_LumaKernel:
	.loc	19	205	0
	cvt.s32.u16 	%r1, %ctaid.x;
	cvt.s32.u16 	%r2, %ntid.x;
	mul24.lo.s32 	%r3, %r1, %r2;
	cvt.s32.u16 	%r4, %ctaid.y;
	cvt.s32.u16 	%r5, %ntid.y;
	mul24.lo.s32 	%r6, %r4, %r5;
	cvt.u32.u16 	%r7, %tid.x;
	add.u32 	%r8, %r3, %r7;
	cvt.u32.u16 	%r9, %tid.y;
	add.u32 	%r10, %r6, %r9;
	ld.param.s32 	%r11, [__cudaparm_LumaCurve_LumaKernel_inWidth];
	set.gt.u32.s32 	%r12, %r11, %r8;
	neg.s32 	%r13, %r12;
	ld.param.s32 	%r14, [__cudaparm_LumaCurve_LumaKernel_inHeight];
	set.gt.u32.s32 	%r15, %r14, %r10;
	neg.s32 	%r16, %r15;
	and.b32 	%r17, %r13, %r16;
	mov.u32 	%r18, 0;
	setp.eq.s32 	%p1, %r17, %r18;
	@%p1 bra 	$Lt_1_14850;
	.loc	16	89	0
	ld.param.s32 	%r19, [__cudaparm_LumaCurve_LumaKernel_inPitch];
	mul24.lo.s32 	%r20, %r10, %r19;
	add.s32 	%r21, %r20, %r8;
	cvt.s64.s32 	%rd1, %r21;
	ld.param.u64 	%rd2, [__cudaparm_LumaCurve_LumaKernel_inImage];
	mul.lo.u64 	%rd3, %rd1, 16;
	add.u64 	%rd4, %rd2, %rd3;
	ld.global.v4.f32 	{%f1,%f2,%f3,_}, [%rd4+0];
	.loc	19	208	0
	ld.param.u64 	%rd5, [__cudaparm_LumaCurve_LumaKernel_inSecondaryMask];
	mov.u64 	%rd6, 0;
	setp.eq.u64 	%p2, %rd5, %rd6;
	@%p2 bra 	$Lt_1_15618;
	.loc	16	89	0
	mul.lo.u64 	%rd7, %rd1, 4;
	add.u64 	%rd8, %rd5, %rd7;
	ld.global.f32 	%f4, [%rd8+0];
	.loc	19	209	0
	mov.f32 	%f5, %f4;
	bra.uni 	$Lt_1_15362;
$Lt_1_15618:
	mov.f32 	%f5, 0f3f800000;     	// 1
$Lt_1_15362:
	.loc	19	66	0
	ld.const.f32 	%f6, [kRGB32f_To_601YPbPr+4];
	mul.f32 	%f7, %f6, %f2;
	ld.const.f32 	%f8, [kRGB32f_To_601YPbPr+0];
	mad.f32 	%f9, %f8, %f3, %f7;
	ld.const.f32 	%f10, [kRGB32f_To_601YPbPr+8];
	mad.f32 	%f11, %f10, %f1, %f9;
	mov.f32 	%f12, %f11;
	mov.u32 	%r22, 0;
	set.eq.u32.u32 	%r23, %r9, %r22;
	neg.s32 	%r24, %r23;
	mov.u32 	%r25, 0;
	set.eq.u32.u32 	%r26, %r7, %r25;
	neg.s32 	%r27, %r26;
	and.b32 	%r28, %r24, %r27;
	mov.u32 	%r29, 0;
	setp.eq.s32 	%p3, %r28, %r29;
	@%p3 bra 	$Lt_1_18946;
	.loc	19	76	0
	mov.u64 	%rd9, sPointsX__2;
	mov.s32 	%r30, 16;
	st.shared.s32 	[sPointCount__1], %r30;
	ld.param.u8 	%r31, [__cudaparm_LumaCurve_LumaKernel_inPointX0];
	cvt.rn.f32.u32 	%f13, %r31;
	mov.f32 	%f14, 0f3b808081;    	// 0.00392157
	mul.f32 	%f15, %f13, %f14;
	st.shared.f32 	[sPointsX__2+0], %f15;
	ld.param.u8 	%r32, [__cudaparm_LumaCurve_LumaKernel_inPointX1];
	cvt.rn.f32.u32 	%f16, %r32;
	mov.f32 	%f17, 0f3b808081;    	// 0.00392157
	mul.f32 	%f18, %f16, %f17;
	st.shared.f32 	[sPointsX__2+4], %f18;
	ld.param.u8 	%r33, [__cudaparm_LumaCurve_LumaKernel_inPointX2];
	cvt.rn.f32.u32 	%f19, %r33;
	mov.f32 	%f20, 0f3b808081;    	// 0.00392157
	mul.f32 	%f21, %f19, %f20;
	st.shared.f32 	[sPointsX__2+8], %f21;
	ld.param.u8 	%r34, [__cudaparm_LumaCurve_LumaKernel_inPointX3];
	cvt.rn.f32.u32 	%f22, %r34;
	mov.f32 	%f23, 0f3b808081;    	// 0.00392157
	mul.f32 	%f24, %f22, %f23;
	st.shared.f32 	[sPointsX__2+12], %f24;
	ld.param.u8 	%r35, [__cudaparm_LumaCurve_LumaKernel_inPointX4];
	cvt.rn.f32.u32 	%f25, %r35;
	mov.f32 	%f26, 0f3b808081;    	// 0.00392157
	mul.f32 	%f27, %f25, %f26;
	st.shared.f32 	[sPointsX__2+16], %f27;
	ld.param.u8 	%r36, [__cudaparm_LumaCurve_LumaKernel_inPointX5];
	cvt.rn.f32.u32 	%f28, %r36;
	mov.f32 	%f29, 0f3b808081;    	// 0.00392157
	mul.f32 	%f30, %f28, %f29;
	st.shared.f32 	[sPointsX__2+20], %f30;
	ld.param.u8 	%r37, [__cudaparm_LumaCurve_LumaKernel_inPointX6];
	cvt.rn.f32.u32 	%f31, %r37;
	mov.f32 	%f32, 0f3b808081;    	// 0.00392157
	mul.f32 	%f33, %f31, %f32;
	st.shared.f32 	[sPointsX__2+24], %f33;
	ld.param.u8 	%r38, [__cudaparm_LumaCurve_LumaKernel_inPointX7];
	cvt.rn.f32.u32 	%f34, %r38;
	mov.f32 	%f35, 0f3b808081;    	// 0.00392157
	mul.f32 	%f36, %f34, %f35;
	st.shared.f32 	[sPointsX__2+28], %f36;
	ld.param.u8 	%r39, [__cudaparm_LumaCurve_LumaKernel_inPointX8];
	cvt.rn.f32.u32 	%f37, %r39;
	mov.f32 	%f38, 0f3b808081;    	// 0.00392157
	mul.f32 	%f39, %f37, %f38;
	st.shared.f32 	[sPointsX__2+32], %f39;
	ld.param.u8 	%r40, [__cudaparm_LumaCurve_LumaKernel_inPointX9];
	cvt.rn.f32.u32 	%f40, %r40;
	mov.f32 	%f41, 0f3b808081;    	// 0.00392157
	mul.f32 	%f42, %f40, %f41;
	st.shared.f32 	[sPointsX__2+36], %f42;
	ld.param.u8 	%r41, [__cudaparm_LumaCurve_LumaKernel_inPointX10];
	cvt.rn.f32.u32 	%f43, %r41;
	mov.f32 	%f44, 0f3b808081;    	// 0.00392157
	mul.f32 	%f45, %f43, %f44;
	st.shared.f32 	[sPointsX__2+40], %f45;
	ld.param.u8 	%r42, [__cudaparm_LumaCurve_LumaKernel_inPointX11];
	cvt.rn.f32.u32 	%f46, %r42;
	mov.f32 	%f47, 0f3b808081;    	// 0.00392157
	mul.f32 	%f48, %f46, %f47;
	st.shared.f32 	[sPointsX__2+44], %f48;
	ld.param.u8 	%r43, [__cudaparm_LumaCurve_LumaKernel_inPointX12];
	cvt.rn.f32.u32 	%f49, %r43;
	mov.f32 	%f50, 0f3b808081;    	// 0.00392157
	mul.f32 	%f51, %f49, %f50;
	st.shared.f32 	[sPointsX__2+48], %f51;
	ld.param.u8 	%r44, [__cudaparm_LumaCurve_LumaKernel_inPointX13];
	cvt.rn.f32.u32 	%f52, %r44;
	mov.f32 	%f53, 0f3b808081;    	// 0.00392157
	mul.f32 	%f54, %f52, %f53;
	st.shared.f32 	[sPointsX__2+52], %f54;
	ld.param.u8 	%r45, [__cudaparm_LumaCurve_LumaKernel_inPointX14];
	cvt.rn.f32.u32 	%f55, %r45;
	mov.f32 	%f56, 0f3b808081;    	// 0.00392157
	mul.f32 	%f57, %f55, %f56;
	st.shared.f32 	[sPointsX__2+56], %f57;
	ld.param.u8 	%r46, [__cudaparm_LumaCurve_LumaKernel_inPointX15];
	cvt.rn.f32.u32 	%f58, %r46;
	mov.f32 	%f59, 0f3b808081;    	// 0.00392157
	mul.f32 	%f60, %f58, %f59;
	st.shared.f32 	[sPointsX__2+60], %f60;
	ld.param.u8 	%r47, [__cudaparm_LumaCurve_LumaKernel_inPointY0];
	cvt.rn.f32.u32 	%f61, %r47;
	mov.f32 	%f62, 0f3b808081;    	// 0.00392157
	mul.f32 	%f63, %f61, %f62;
	st.shared.f32 	[sPointsY__3+0], %f63;
	ld.param.u8 	%r48, [__cudaparm_LumaCurve_LumaKernel_inPointY1];
	cvt.rn.f32.u32 	%f64, %r48;
	mov.f32 	%f65, 0f3b808081;    	// 0.00392157
	mul.f32 	%f66, %f64, %f65;
	st.shared.f32 	[sPointsY__3+4], %f66;
	ld.param.u8 	%r49, [__cudaparm_LumaCurve_LumaKernel_inPointY2];
	cvt.rn.f32.u32 	%f67, %r49;
	mov.f32 	%f68, 0f3b808081;    	// 0.00392157
	mul.f32 	%f69, %f67, %f68;
	st.shared.f32 	[sPointsY__3+8], %f69;
	ld.param.u8 	%r50, [__cudaparm_LumaCurve_LumaKernel_inPointY3];
	cvt.rn.f32.u32 	%f70, %r50;
	mov.f32 	%f71, 0f3b808081;    	// 0.00392157
	mul.f32 	%f72, %f70, %f71;
	st.shared.f32 	[sPointsY__3+12], %f72;
	ld.param.u8 	%r51, [__cudaparm_LumaCurve_LumaKernel_inPointY4];
	cvt.rn.f32.u32 	%f73, %r51;
	mov.f32 	%f74, 0f3b808081;    	// 0.00392157
	mul.f32 	%f75, %f73, %f74;
	st.shared.f32 	[sPointsY__3+16], %f75;
	ld.param.u8 	%r52, [__cudaparm_LumaCurve_LumaKernel_inPointY5];
	cvt.rn.f32.u32 	%f76, %r52;
	mov.f32 	%f77, 0f3b808081;    	// 0.00392157
	mul.f32 	%f78, %f76, %f77;
	st.shared.f32 	[sPointsY__3+20], %f78;
	ld.param.u8 	%r53, [__cudaparm_LumaCurve_LumaKernel_inPointY6];
	cvt.rn.f32.u32 	%f79, %r53;
	mov.f32 	%f80, 0f3b808081;    	// 0.00392157
	mul.f32 	%f81, %f79, %f80;
	st.shared.f32 	[sPointsY__3+24], %f81;
	ld.param.u8 	%r54, [__cudaparm_LumaCurve_LumaKernel_inPointY7];
	cvt.rn.f32.u32 	%f82, %r54;
	mov.f32 	%f83, 0f3b808081;    	// 0.00392157
	mul.f32 	%f84, %f82, %f83;
	st.shared.f32 	[sPointsY__3+28], %f84;
	ld.param.u8 	%r55, [__cudaparm_LumaCurve_LumaKernel_inPointY8];
	cvt.rn.f32.u32 	%f85, %r55;
	mov.f32 	%f86, 0f3b808081;    	// 0.00392157
	mul.f32 	%f87, %f85, %f86;
	st.shared.f32 	[sPointsY__3+32], %f87;
	ld.param.u8 	%r56, [__cudaparm_LumaCurve_LumaKernel_inPointY9];
	cvt.rn.f32.u32 	%f88, %r56;
	mov.f32 	%f89, 0f3b808081;    	// 0.00392157
	mul.f32 	%f90, %f88, %f89;
	st.shared.f32 	[sPointsY__3+36], %f90;
	ld.param.u8 	%r57, [__cudaparm_LumaCurve_LumaKernel_inPointY10];
	cvt.rn.f32.u32 	%f91, %r57;
	mov.f32 	%f92, 0f3b808081;    	// 0.00392157
	mul.f32 	%f93, %f91, %f92;
	st.shared.f32 	[sPointsY__3+40], %f93;
	ld.param.u8 	%r58, [__cudaparm_LumaCurve_LumaKernel_inPointY11];
	cvt.rn.f32.u32 	%f94, %r58;
	mov.f32 	%f95, 0f3b808081;    	// 0.00392157
	mul.f32 	%f96, %f94, %f95;
	st.shared.f32 	[sPointsY__3+44], %f96;
	ld.param.u8 	%r59, [__cudaparm_LumaCurve_LumaKernel_inPointY12];
	cvt.rn.f32.u32 	%f97, %r59;
	mov.f32 	%f98, 0f3b808081;    	// 0.00392157
	mul.f32 	%f99, %f97, %f98;
	st.shared.f32 	[sPointsY__3+48], %f99;
	ld.param.u8 	%r60, [__cudaparm_LumaCurve_LumaKernel_inPointY13];
	cvt.rn.f32.u32 	%f100, %r60;
	mov.f32 	%f101, 0f3b808081;   	// 0.00392157
	mul.f32 	%f102, %f100, %f101;
	st.shared.f32 	[sPointsY__3+52], %f102;
	ld.param.u8 	%r61, [__cudaparm_LumaCurve_LumaKernel_inPointY14];
	cvt.rn.f32.u32 	%f103, %r61;
	mov.f32 	%f104, 0f3b808081;   	// 0.00392157
	mul.f32 	%f105, %f103, %f104;
	st.shared.f32 	[sPointsY__3+56], %f105;
	ld.param.u8 	%r62, [__cudaparm_LumaCurve_LumaKernel_inPointY15];
	cvt.rn.f32.u32 	%f106, %r62;
	mov.f32 	%f107, 0f3b808081;   	// 0.00392157
	mul.f32 	%f108, %f106, %f107;
	st.shared.f32 	[sPointsY__3+60], %f108;
	mov.u64 	%rd10, 0;
	mov.s64 	%rd11, %rd9;
	mov.s32 	%r63, 0;
	mov.u64 	%rd12, sPointsY__3;
$Lt_1_16898:
 //<loop> Loop body line 76, nesting depth: 1, iterations: 16
	.loc	19	113	0
	ld.shared.f32 	%f109, [%rd11+0];
	mov.f32 	%f110, 0f00000000;   	// 0
	setp.neu.f32 	%p4, %f109, %f110;
	@%p4 bra 	$L_1_14082;
 //<loop> Part of loop body line 76, head labeled $Lt_1_16898
	add.u64 	%rd13, %rd10, %rd12;
	ld.shared.f32 	%f111, [%rd13+0];
	mov.f32 	%f112, 0f00000000;   	// 0
	setp.neu.f32 	%p5, %f111, %f112;
	@!%p5 bra 	$L_1_13826;
$L_1_14082:
 //<loop> Part of loop body line 76, head labeled $Lt_1_16898
	.loc	19	115	0
	add.s32 	%r30, %r63, 1;
	st.shared.s32 	[sPointCount__1], %r30;
$L_1_13826:
 //<loop> Part of loop body line 76, head labeled $Lt_1_16898
	add.s32 	%r64, %r63, 1;
	mov.s32 	%r63, %r64;
	add.u64 	%rd10, %rd10, 4;
	add.u64 	%rd11, %rd11, 4;
	mov.u32 	%r65, 16;
	setp.ne.s32 	%p6, %r64, %r65;
	@%p6 bra 	$Lt_1_16898;
	.loc	19	118	0
	mov.f32 	%f113, 0f00000000;   	// 0
	st.shared.f32 	[u__0+0], %f113;
	.loc	18	48	0
	mov.f32 	%f114, 0f00000000;   	// 0
	st.shared.f32 	[sPointsY2__4+0], %f114;
	cvt.u64.s32 	%rd14, %r30;
	mov.s64 	%rd15, %rd14;
	cvt.u32.u64 	%r66, %rd15;
	sub.s32 	%r67, %r66, 1;
	sub.s32 	%r68, %r66, 2;
	mov.u32 	%r69, 1;
	setp.le.s32 	%p7, %r67, %r69;
	@%p7 bra 	$Lt_1_17410;
	mov.s32 	%r70, %r68;
	mov.u64 	%rd16, 4;
	mov.s32 	%r71, 1;
	mov.u64 	%rd17, sPointsY2__4;
	mov.u64 	%rd18, u__0;
	mov.s32 	%r72, %r70;
$Lt_1_17922:
 //<loop> Loop body line 48, nesting depth: 1, estimated iterations: unknown
	.loc	18	53	0
	add.u64 	%rd19, %rd16, %rd18;
	mov.f32 	%f115, 0f00000000;   	// 0
	st.shared.f32 	[%rd19+0], %f115;
	add.u64 	%rd20, %rd16, %rd17;
	mov.f32 	%f116, 0f00000000;   	// 0
	st.shared.f32 	[%rd20+0], %f116;
	add.u64 	%rd21, %rd16, %rd9;
	ld.shared.f32 	%f117, [%rd21+-4];
	ld.shared.f32 	%f118, [%rd21+0];
	setp.lt.f32 	%p8, %f117, %f118;
	@!%p8 bra 	$Lt_1_24322;
 //<loop> Part of loop body line 48, head labeled $Lt_1_17922
	ld.shared.f32 	%f119, [%rd21+4];
	ld.shared.f32 	%f118, [%rd21+0];
	setp.lt.f32 	%p9, %f118, %f119;
	@!%p9 bra 	$Lt_1_24322;
 //<loop> Part of loop body line 48, head labeled $Lt_1_17922
	ld.shared.f32 	%f118, [%rd21+0];
	ld.shared.f32 	%f117, [%rd21+-4];
	.loc	18	56	0
	sub.f32 	%f120, %f118, %f117;
	.loc	18	53	0
	ld.shared.f32 	%f119, [%rd21+4];
	.loc	18	56	0
	sub.f32 	%f121, %f119, %f117;
	.loc	18	57	0
	div.full.f32 	%f122, %f120, %f121;
	mov.f32 	%f123, 0f40000000;   	// 2
	ld.shared.f32 	%f124, [%rd20+-4];
	mad.f32 	%f125, %f124, %f122, %f123;
	mov.f32 	%f126, 0f00000000;   	// 0
	setp.neu.f32 	%p10, %f125, %f126;
	@!%p10 bra 	$Lt_1_24322;
 //<loop> Part of loop body line 48, head labeled $Lt_1_17922
	.loc	18	60	0
	mov.f32 	%f127, 0fbf800000;   	// -1
	add.f32 	%f128, %f122, %f127;
	div.full.f32 	%f129, %f128, %f125;
	st.shared.f32 	[%rd20+0], %f129;
	.loc	18	61	0
	add.u64 	%rd22, %rd16, %rd12;
	ld.shared.f32 	%f130, [%rd22+0];
	ld.shared.f32 	%f131, [%rd22+4];
	sub.f32 	%f132, %f131, %f130;
	sub.f32 	%f133, %f119, %f118;
	ld.shared.f32 	%f134, [%rd22+-4];
	sub.f32 	%f135, %f130, %f134;
	div.full.f32 	%f136, %f132, %f133;
	div.full.f32 	%f137, %f135, %f120;
	sub.f32 	%f138, %f136, %f137;
	st.shared.f32 	[%rd19+0], %f138;
	.loc	18	62	0
	mov.f32 	%f139, 0f40c00000;   	// 6
	mul.f32 	%f140, %f138, %f139;
	div.full.f32 	%f141, %f140, %f121;
	ld.shared.f32 	%f142, [%rd19+-4];
	mul.f32 	%f143, %f142, %f122;
	sub.f32 	%f144, %f141, %f143;
	div.full.f32 	%f145, %f144, %f125;
	st.shared.f32 	[%rd19+0], %f145;
$Lt_1_24322:
$L_1_14338:
 //<loop> Part of loop body line 48, head labeled $Lt_1_17922
	.loc	18	56	0
	add.s32 	%r71, %r71, 1;
	add.u64 	%rd16, %rd16, 4;
	setp.ne.s32 	%p11, %r67, %r71;
	@%p11 bra 	$Lt_1_17922;
$Lt_1_17410:
	mov.u64 	%rd18, u__0;
	mov.u64 	%rd17, sPointsY2__4;
	.loc	18	69	0
	mov.f32 	%f146, 0f00000000;   	// 0
	mul.lo.u64 	%rd23, %rd14, 4;
	add.u64 	%rd24, %rd17, %rd23;
	st.shared.f32 	[%rd24+-4], %f146;
	.loc	18	72	0
	mov.s32 	%r73, %r68;
	mov.u32 	%r74, 0;
	setp.lt.s32 	%p12, %r68, %r74;
	@%p12 bra 	$Lt_1_18946;
	mov.s32 	%r75, %r67;
	cvt.u64.s32 	%rd25, %r68;
	mul.lo.u64 	%rd26, %rd25, 4;
	add.u64 	%rd27, %rd26, %rd18;
	add.u64 	%rd28, %rd26, %rd17;
	mov.s32 	%r76, %r75;
$Lt_1_19458:
 //<loop> Loop body line 72, nesting depth: 1, estimated iterations: unknown
	.loc	18	74	0
	ld.shared.f32 	%f147, [%rd27+0];
	ld.shared.f32 	%f148, [%rd28+0];
	ld.shared.f32 	%f149, [%rd28+4];
	mad.f32 	%f150, %f148, %f149, %f147;
	st.shared.f32 	[%rd28+0], %f150;
	sub.s32 	%r73, %r73, 1;
	sub.u64 	%rd28, %rd28, 4;
	sub.u64 	%rd27, %rd27, 4;
	mov.u32 	%r77, -1;
	setp.ne.s32 	%p13, %r73, %r77;
	@%p13 bra 	$Lt_1_19458;
$Lt_1_18946:
$Lt_1_15874:
	mov.u64 	%rd9, sPointsX__2;
	mov.u64 	%rd17, sPointsY2__4;
	mov.u64 	%rd12, sPointsY__3;
	.loc	19	121	0
	bar.sync 	0;
	mov.f32 	%f151, 0f3a83126f;   	// 0.001
	setp.gt.f32 	%p14, %f5, %f151;
	@!%p14 bra 	$Lt_1_19970;
	.loc	19	130	0
	mov.f32 	%f152, 0f00000000;   	// 0
	setp.lt.f32 	%p15, %f11, %f152;
	@!%p15 bra 	$Lt_1_20738;
	.loc	18	134	0
	ld.shared.f32 	%f153, [sPointsY__3+0];
	add.f32 	%f154, %f153, %f11;
	bra.uni 	$Lt_1_20994;
$Lt_1_20738:
	ld.shared.s32 	%r78, [sPointCount__1];
	cvt.u64.s32 	%rd14, %r78;
	mov.f32 	%f155, 0f3f800000;   	// 1
	setp.gt.f32 	%p16, %f11, %f155;
	@!%p16 bra 	$Lt_1_21250;
	.loc	18	138	0
	mov.f32 	%f156, 0f3f800000;   	// 1
	mul.lo.u64 	%rd29, %rd14, 4;
	add.u64 	%rd30, %rd12, %rd29;
	ld.shared.f32 	%f157, [%rd30+-4];
	sub.f32 	%f158, %f156, %f157;
	sub.f32 	%f154, %f11, %f158;
	bra.uni 	$Lt_1_20994;
$Lt_1_21250:
	.loc	18	88	0
	mov.f32 	%f159, %f11;
	.loc	18	92	0
	sub.u64 	%rd31, %rd14, 1;
	mov.s64 	%rd32, %rd31;
	mov.u64 	%rd33, 1;
	setp.le.u64 	%p17, %rd31, %rd33;
	mov.u64 	%rd34, 0;
	@%p17 bra 	$Lt_1_25090;
$Lt_1_22018:
 //<loop> Loop body line 92
	add.u64 	%rd35, %rd32, %rd34;
	shr.u64 	%rd36, %rd35, 1;
	mul.lo.u64 	%rd37, %rd36, 4;
	add.u64 	%rd38, %rd9, %rd37;
	ld.shared.f32 	%f160, [%rd38+0];
	setp.gt.f32 	%p18, %f160, %f11;
	@!%p18 bra 	$Lt_1_22530;
 //<loop> Part of loop body line 92, head labeled $Lt_1_22018
	.loc	18	101	0
	mov.s64 	%rd32, %rd36;
	bra.uni 	$Lt_1_22274;
$Lt_1_22530:
 //<loop> Part of loop body line 92, head labeled $Lt_1_22018
	.loc	18	105	0
	mov.s64 	%rd34, %rd36;
$Lt_1_22274:
 //<loop> Part of loop body line 92, head labeled $Lt_1_22018
	sub.u64 	%rd39, %rd32, %rd34;
	mov.u64 	%rd40, 1;
	setp.gt.u64 	%p19, %rd39, %rd40;
	@%p19 bra 	$Lt_1_22018;
	bra.uni 	$Lt_1_21506;
$Lt_1_25090:
$Lt_1_21506:
	.loc	18	109	0
	mul.lo.u64 	%rd41, %rd32, 4;
	mul.lo.u64 	%rd42, %rd34, 4;
	add.u64 	%rd43, %rd41, %rd9;
	add.u64 	%rd44, %rd42, %rd9;
	ld.shared.f32 	%f161, [%rd43+0];
	ld.shared.f32 	%f162, [%rd44+0];
	sub.f32 	%f163, %f161, %f162;
	mov.f32 	%f164, 0f00000000;   	// 0
	setp.neu.f32 	%p20, %f163, %f164;
	@!%p20 bra 	$Lt_1_23042;
	ld.shared.f32 	%f161, [%rd43+0];
	.loc	18	112	0
	sub.f32 	%f165, %f161, %f11;
	.loc	18	109	0
	ld.shared.f32 	%f162, [%rd44+0];
	.loc	18	113	0
	sub.f32 	%f166, %f11, %f162;
	.loc	18	114	0
	div.full.f32 	%f167, %f166, %f163;
	div.full.f32 	%f168, %f165, %f163;
	add.u64 	%rd45, %rd41, %rd17;
	ld.shared.f32 	%f169, [%rd45+0];
	mul.f32 	%f170, %f167, %f167;
	mul.f32 	%f171, %f167, %f170;
	sub.f32 	%f172, %f171, %f167;
	mul.f32 	%f173, %f169, %f172;
	add.u64 	%rd46, %rd42, %rd17;
	ld.shared.f32 	%f174, [%rd46+0];
	mul.f32 	%f175, %f168, %f168;
	mul.f32 	%f176, %f168, %f175;
	sub.f32 	%f177, %f176, %f168;
	mad.f32 	%f178, %f174, %f177, %f173;
	mul.f32 	%f179, %f163, %f163;
	mul.f32 	%f180, %f178, %f179;
	mov.f32 	%f181, 0f40c00000;   	// 6
	div.full.f32 	%f182, %f180, %f181;
	add.u64 	%rd47, %rd41, %rd12;
	ld.shared.f32 	%f183, [%rd47+0];
	mul.f32 	%f184, %f183, %f167;
	add.u64 	%rd48, %rd42, %rd12;
	ld.shared.f32 	%f185, [%rd48+0];
	mad.f32 	%f186, %f185, %f168, %f184;
	add.f32 	%f159, %f182, %f186;
$Lt_1_23042:
	.loc	18	142	0
	mov.f32 	%f154, %f159;
$Lt_1_20994:
$Lt_1_20482:
	.loc	19	131	0
	sub.f32 	%f187, %f154, %f11;
	mad.f32 	%f12, %f5, %f187, %f11;
$Lt_1_19970:
	.loc	16	100	0
	ld.const.f32 	%f188, [k601YPbPr_To_RGB32f+24];
	mul.f32 	%f189, %f188, %f12;
	ld.const.f32 	%f190, [k601YPbPr_To_RGB32f+12];
	mul.f32 	%f191, %f190, %f12;
	ld.const.f32 	%f192, [k601YPbPr_To_RGB32f+0];
	mul.f32 	%f193, %f192, %f12;
	mov.f32 	%f194, 0f3f800000;   	// 1
	st.global.v4.f32 	[%rd4+0], {%f189,%f191,%f193,%f194};
$Lt_1_14850:
	.loc	19	251	0
	exit;
$LDWend_LumaCurve_LumaKernel:
	} // LumaCurve_LumaKernel

	.entry LumaCurve_CompositeKernel (
		.param .u64 __cudaparm_LumaCurve_CompositeKernel_inImage,
		.param .s32 __cudaparm_LumaCurve_CompositeKernel_inPitch,
		.param .u64 __cudaparm_LumaCurve_CompositeKernel_inSecondaryMask,
		.param .s32 __cudaparm_LumaCurve_CompositeKernel_inWidth,
		.param .s32 __cudaparm_LumaCurve_CompositeKernel_inHeight,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX0,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX1,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX2,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX3,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX4,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX5,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX6,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX7,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX8,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX9,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX10,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX11,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX12,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX13,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX14,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointX15,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY0,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY1,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY2,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY3,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY4,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY5,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY6,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY7,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY8,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY9,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY10,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY11,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY12,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY13,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY14,
		.param .u8 __cudaparm_LumaCurve_CompositeKernel_inPointY15)
	{
	.reg .u32 %r<80>;
	.reg .u64 %rd<50>;
	.reg .f32 %f<220>;
	.reg .pred %p<22>;
	.loc	19	293	0
$LBB1_LumaCurve_CompositeKernel:
	.loc	19	296	0
	cvt.s32.u16 	%r1, %ctaid.x;
	cvt.s32.u16 	%r2, %ntid.x;
	mul24.lo.s32 	%r3, %r1, %r2;
	cvt.s32.u16 	%r4, %ctaid.y;
	cvt.s32.u16 	%r5, %ntid.y;
	mul24.lo.s32 	%r6, %r4, %r5;
	cvt.u32.u16 	%r7, %tid.x;
	add.u32 	%r8, %r3, %r7;
	cvt.u32.u16 	%r9, %tid.y;
	add.u32 	%r10, %r6, %r9;
	ld.param.s32 	%r11, [__cudaparm_LumaCurve_CompositeKernel_inWidth];
	set.gt.u32.s32 	%r12, %r11, %r8;
	neg.s32 	%r13, %r12;
	ld.param.s32 	%r14, [__cudaparm_LumaCurve_CompositeKernel_inHeight];
	set.gt.u32.s32 	%r15, %r14, %r10;
	neg.s32 	%r16, %r15;
	and.b32 	%r17, %r13, %r16;
	mov.u32 	%r18, 0;
	setp.eq.s32 	%p1, %r17, %r18;
	@%p1 bra 	$Lt_2_14850;
	.loc	16	89	0
	ld.param.s32 	%r19, [__cudaparm_LumaCurve_CompositeKernel_inPitch];
	mul24.lo.s32 	%r20, %r10, %r19;
	add.s32 	%r21, %r20, %r8;
	cvt.s64.s32 	%rd1, %r21;
	ld.param.u64 	%rd2, [__cudaparm_LumaCurve_CompositeKernel_inImage];
	mul.lo.u64 	%rd3, %rd1, 16;
	add.u64 	%rd4, %rd2, %rd3;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd4+0];
	.loc	19	299	0
	ld.param.u64 	%rd5, [__cudaparm_LumaCurve_CompositeKernel_inSecondaryMask];
	mov.u64 	%rd6, 0;
	setp.eq.u64 	%p2, %rd5, %rd6;
	@%p2 bra 	$Lt_2_15618;
	.loc	16	89	0
	mul.lo.u64 	%rd7, %rd1, 4;
	add.u64 	%rd8, %rd5, %rd7;
	ld.global.f32 	%f5, [%rd8+0];
	.loc	19	300	0
	mov.f32 	%f6, %f5;
	bra.uni 	$Lt_2_15362;
$Lt_2_15618:
	mov.f32 	%f6, 0f3f800000;     	// 1
$Lt_2_15362:
	.loc	19	66	0
	ld.const.f32 	%f7, [kRGB32f_To_601YPbPr+4];
	mul.f32 	%f8, %f7, %f2;
	ld.const.f32 	%f9, [kRGB32f_To_601YPbPr+0];
	mad.f32 	%f10, %f9, %f3, %f8;
	ld.const.f32 	%f11, [kRGB32f_To_601YPbPr+8];
	mad.f32 	%f12, %f11, %f1, %f10;
	mov.f32 	%f13, %f12;
	mov.u32 	%r22, 0;
	set.eq.u32.u32 	%r23, %r9, %r22;
	neg.s32 	%r24, %r23;
	mov.u32 	%r25, 0;
	set.eq.u32.u32 	%r26, %r7, %r25;
	neg.s32 	%r27, %r26;
	and.b32 	%r28, %r24, %r27;
	mov.u32 	%r29, 0;
	setp.eq.s32 	%p3, %r28, %r29;
	@%p3 bra 	$Lt_2_18946;
	.loc	19	76	0
	mov.u64 	%rd9, sPointsX__2;
	mov.s32 	%r30, 16;
	st.shared.s32 	[sPointCount__1], %r30;
	ld.param.u8 	%r31, [__cudaparm_LumaCurve_CompositeKernel_inPointX0];
	cvt.rn.f32.u32 	%f14, %r31;
	mov.f32 	%f15, 0f3b808081;    	// 0.00392157
	mul.f32 	%f16, %f14, %f15;
	st.shared.f32 	[sPointsX__2+0], %f16;
	ld.param.u8 	%r32, [__cudaparm_LumaCurve_CompositeKernel_inPointX1];
	cvt.rn.f32.u32 	%f17, %r32;
	mov.f32 	%f18, 0f3b808081;    	// 0.00392157
	mul.f32 	%f19, %f17, %f18;
	st.shared.f32 	[sPointsX__2+4], %f19;
	ld.param.u8 	%r33, [__cudaparm_LumaCurve_CompositeKernel_inPointX2];
	cvt.rn.f32.u32 	%f20, %r33;
	mov.f32 	%f21, 0f3b808081;    	// 0.00392157
	mul.f32 	%f22, %f20, %f21;
	st.shared.f32 	[sPointsX__2+8], %f22;
	ld.param.u8 	%r34, [__cudaparm_LumaCurve_CompositeKernel_inPointX3];
	cvt.rn.f32.u32 	%f23, %r34;
	mov.f32 	%f24, 0f3b808081;    	// 0.00392157
	mul.f32 	%f25, %f23, %f24;
	st.shared.f32 	[sPointsX__2+12], %f25;
	ld.param.u8 	%r35, [__cudaparm_LumaCurve_CompositeKernel_inPointX4];
	cvt.rn.f32.u32 	%f26, %r35;
	mov.f32 	%f27, 0f3b808081;    	// 0.00392157
	mul.f32 	%f28, %f26, %f27;
	st.shared.f32 	[sPointsX__2+16], %f28;
	ld.param.u8 	%r36, [__cudaparm_LumaCurve_CompositeKernel_inPointX5];
	cvt.rn.f32.u32 	%f29, %r36;
	mov.f32 	%f30, 0f3b808081;    	// 0.00392157
	mul.f32 	%f31, %f29, %f30;
	st.shared.f32 	[sPointsX__2+20], %f31;
	ld.param.u8 	%r37, [__cudaparm_LumaCurve_CompositeKernel_inPointX6];
	cvt.rn.f32.u32 	%f32, %r37;
	mov.f32 	%f33, 0f3b808081;    	// 0.00392157
	mul.f32 	%f34, %f32, %f33;
	st.shared.f32 	[sPointsX__2+24], %f34;
	ld.param.u8 	%r38, [__cudaparm_LumaCurve_CompositeKernel_inPointX7];
	cvt.rn.f32.u32 	%f35, %r38;
	mov.f32 	%f36, 0f3b808081;    	// 0.00392157
	mul.f32 	%f37, %f35, %f36;
	st.shared.f32 	[sPointsX__2+28], %f37;
	ld.param.u8 	%r39, [__cudaparm_LumaCurve_CompositeKernel_inPointX8];
	cvt.rn.f32.u32 	%f38, %r39;
	mov.f32 	%f39, 0f3b808081;    	// 0.00392157
	mul.f32 	%f40, %f38, %f39;
	st.shared.f32 	[sPointsX__2+32], %f40;
	ld.param.u8 	%r40, [__cudaparm_LumaCurve_CompositeKernel_inPointX9];
	cvt.rn.f32.u32 	%f41, %r40;
	mov.f32 	%f42, 0f3b808081;    	// 0.00392157
	mul.f32 	%f43, %f41, %f42;
	st.shared.f32 	[sPointsX__2+36], %f43;
	ld.param.u8 	%r41, [__cudaparm_LumaCurve_CompositeKernel_inPointX10];
	cvt.rn.f32.u32 	%f44, %r41;
	mov.f32 	%f45, 0f3b808081;    	// 0.00392157
	mul.f32 	%f46, %f44, %f45;
	st.shared.f32 	[sPointsX__2+40], %f46;
	ld.param.u8 	%r42, [__cudaparm_LumaCurve_CompositeKernel_inPointX11];
	cvt.rn.f32.u32 	%f47, %r42;
	mov.f32 	%f48, 0f3b808081;    	// 0.00392157
	mul.f32 	%f49, %f47, %f48;
	st.shared.f32 	[sPointsX__2+44], %f49;
	ld.param.u8 	%r43, [__cudaparm_LumaCurve_CompositeKernel_inPointX12];
	cvt.rn.f32.u32 	%f50, %r43;
	mov.f32 	%f51, 0f3b808081;    	// 0.00392157
	mul.f32 	%f52, %f50, %f51;
	st.shared.f32 	[sPointsX__2+48], %f52;
	ld.param.u8 	%r44, [__cudaparm_LumaCurve_CompositeKernel_inPointX13];
	cvt.rn.f32.u32 	%f53, %r44;
	mov.f32 	%f54, 0f3b808081;    	// 0.00392157
	mul.f32 	%f55, %f53, %f54;
	st.shared.f32 	[sPointsX__2+52], %f55;
	ld.param.u8 	%r45, [__cudaparm_LumaCurve_CompositeKernel_inPointX14];
	cvt.rn.f32.u32 	%f56, %r45;
	mov.f32 	%f57, 0f3b808081;    	// 0.00392157
	mul.f32 	%f58, %f56, %f57;
	st.shared.f32 	[sPointsX__2+56], %f58;
	ld.param.u8 	%r46, [__cudaparm_LumaCurve_CompositeKernel_inPointX15];
	cvt.rn.f32.u32 	%f59, %r46;
	mov.f32 	%f60, 0f3b808081;    	// 0.00392157
	mul.f32 	%f61, %f59, %f60;
	st.shared.f32 	[sPointsX__2+60], %f61;
	ld.param.u8 	%r47, [__cudaparm_LumaCurve_CompositeKernel_inPointY0];
	cvt.rn.f32.u32 	%f62, %r47;
	mov.f32 	%f63, 0f3b808081;    	// 0.00392157
	mul.f32 	%f64, %f62, %f63;
	st.shared.f32 	[sPointsY__3+0], %f64;
	ld.param.u8 	%r48, [__cudaparm_LumaCurve_CompositeKernel_inPointY1];
	cvt.rn.f32.u32 	%f65, %r48;
	mov.f32 	%f66, 0f3b808081;    	// 0.00392157
	mul.f32 	%f67, %f65, %f66;
	st.shared.f32 	[sPointsY__3+4], %f67;
	ld.param.u8 	%r49, [__cudaparm_LumaCurve_CompositeKernel_inPointY2];
	cvt.rn.f32.u32 	%f68, %r49;
	mov.f32 	%f69, 0f3b808081;    	// 0.00392157
	mul.f32 	%f70, %f68, %f69;
	st.shared.f32 	[sPointsY__3+8], %f70;
	ld.param.u8 	%r50, [__cudaparm_LumaCurve_CompositeKernel_inPointY3];
	cvt.rn.f32.u32 	%f71, %r50;
	mov.f32 	%f72, 0f3b808081;    	// 0.00392157
	mul.f32 	%f73, %f71, %f72;
	st.shared.f32 	[sPointsY__3+12], %f73;
	ld.param.u8 	%r51, [__cudaparm_LumaCurve_CompositeKernel_inPointY4];
	cvt.rn.f32.u32 	%f74, %r51;
	mov.f32 	%f75, 0f3b808081;    	// 0.00392157
	mul.f32 	%f76, %f74, %f75;
	st.shared.f32 	[sPointsY__3+16], %f76;
	ld.param.u8 	%r52, [__cudaparm_LumaCurve_CompositeKernel_inPointY5];
	cvt.rn.f32.u32 	%f77, %r52;
	mov.f32 	%f78, 0f3b808081;    	// 0.00392157
	mul.f32 	%f79, %f77, %f78;
	st.shared.f32 	[sPointsY__3+20], %f79;
	ld.param.u8 	%r53, [__cudaparm_LumaCurve_CompositeKernel_inPointY6];
	cvt.rn.f32.u32 	%f80, %r53;
	mov.f32 	%f81, 0f3b808081;    	// 0.00392157
	mul.f32 	%f82, %f80, %f81;
	st.shared.f32 	[sPointsY__3+24], %f82;
	ld.param.u8 	%r54, [__cudaparm_LumaCurve_CompositeKernel_inPointY7];
	cvt.rn.f32.u32 	%f83, %r54;
	mov.f32 	%f84, 0f3b808081;    	// 0.00392157
	mul.f32 	%f85, %f83, %f84;
	st.shared.f32 	[sPointsY__3+28], %f85;
	ld.param.u8 	%r55, [__cudaparm_LumaCurve_CompositeKernel_inPointY8];
	cvt.rn.f32.u32 	%f86, %r55;
	mov.f32 	%f87, 0f3b808081;    	// 0.00392157
	mul.f32 	%f88, %f86, %f87;
	st.shared.f32 	[sPointsY__3+32], %f88;
	ld.param.u8 	%r56, [__cudaparm_LumaCurve_CompositeKernel_inPointY9];
	cvt.rn.f32.u32 	%f89, %r56;
	mov.f32 	%f90, 0f3b808081;    	// 0.00392157
	mul.f32 	%f91, %f89, %f90;
	st.shared.f32 	[sPointsY__3+36], %f91;
	ld.param.u8 	%r57, [__cudaparm_LumaCurve_CompositeKernel_inPointY10];
	cvt.rn.f32.u32 	%f92, %r57;
	mov.f32 	%f93, 0f3b808081;    	// 0.00392157
	mul.f32 	%f94, %f92, %f93;
	st.shared.f32 	[sPointsY__3+40], %f94;
	ld.param.u8 	%r58, [__cudaparm_LumaCurve_CompositeKernel_inPointY11];
	cvt.rn.f32.u32 	%f95, %r58;
	mov.f32 	%f96, 0f3b808081;    	// 0.00392157
	mul.f32 	%f97, %f95, %f96;
	st.shared.f32 	[sPointsY__3+44], %f97;
	ld.param.u8 	%r59, [__cudaparm_LumaCurve_CompositeKernel_inPointY12];
	cvt.rn.f32.u32 	%f98, %r59;
	mov.f32 	%f99, 0f3b808081;    	// 0.00392157
	mul.f32 	%f100, %f98, %f99;
	st.shared.f32 	[sPointsY__3+48], %f100;
	ld.param.u8 	%r60, [__cudaparm_LumaCurve_CompositeKernel_inPointY13];
	cvt.rn.f32.u32 	%f101, %r60;
	mov.f32 	%f102, 0f3b808081;   	// 0.00392157
	mul.f32 	%f103, %f101, %f102;
	st.shared.f32 	[sPointsY__3+52], %f103;
	ld.param.u8 	%r61, [__cudaparm_LumaCurve_CompositeKernel_inPointY14];
	cvt.rn.f32.u32 	%f104, %r61;
	mov.f32 	%f105, 0f3b808081;   	// 0.00392157
	mul.f32 	%f106, %f104, %f105;
	st.shared.f32 	[sPointsY__3+56], %f106;
	ld.param.u8 	%r62, [__cudaparm_LumaCurve_CompositeKernel_inPointY15];
	cvt.rn.f32.u32 	%f107, %r62;
	mov.f32 	%f108, 0f3b808081;   	// 0.00392157
	mul.f32 	%f109, %f107, %f108;
	st.shared.f32 	[sPointsY__3+60], %f109;
	mov.u64 	%rd10, 0;
	mov.s64 	%rd11, %rd9;
	mov.s32 	%r63, 0;
	mov.u64 	%rd12, sPointsY__3;
$Lt_2_16898:
 //<loop> Loop body line 76, nesting depth: 1, iterations: 16
	.loc	19	113	0
	ld.shared.f32 	%f110, [%rd11+0];
	mov.f32 	%f111, 0f00000000;   	// 0
	setp.neu.f32 	%p4, %f110, %f111;
	@%p4 bra 	$L_2_14082;
 //<loop> Part of loop body line 76, head labeled $Lt_2_16898
	add.u64 	%rd13, %rd10, %rd12;
	ld.shared.f32 	%f112, [%rd13+0];
	mov.f32 	%f113, 0f00000000;   	// 0
	setp.neu.f32 	%p5, %f112, %f113;
	@!%p5 bra 	$L_2_13826;
$L_2_14082:
 //<loop> Part of loop body line 76, head labeled $Lt_2_16898
	.loc	19	115	0
	add.s32 	%r30, %r63, 1;
	st.shared.s32 	[sPointCount__1], %r30;
$L_2_13826:
 //<loop> Part of loop body line 76, head labeled $Lt_2_16898
	add.s32 	%r64, %r63, 1;
	mov.s32 	%r63, %r64;
	add.u64 	%rd10, %rd10, 4;
	add.u64 	%rd11, %rd11, 4;
	mov.u32 	%r65, 16;
	setp.ne.s32 	%p6, %r64, %r65;
	@%p6 bra 	$Lt_2_16898;
	.loc	19	118	0
	mov.f32 	%f114, 0f00000000;   	// 0
	st.shared.f32 	[u__0+0], %f114;
	.loc	18	48	0
	mov.f32 	%f115, 0f00000000;   	// 0
	st.shared.f32 	[sPointsY2__4+0], %f115;
	cvt.u64.s32 	%rd14, %r30;
	mov.s64 	%rd15, %rd14;
	cvt.u32.u64 	%r66, %rd15;
	sub.s32 	%r67, %r66, 1;
	sub.s32 	%r68, %r66, 2;
	mov.u32 	%r69, 1;
	setp.le.s32 	%p7, %r67, %r69;
	@%p7 bra 	$Lt_2_17410;
	mov.s32 	%r70, %r68;
	mov.u64 	%rd16, 4;
	mov.s32 	%r71, 1;
	mov.u64 	%rd17, sPointsY2__4;
	mov.u64 	%rd18, u__0;
	mov.s32 	%r72, %r70;
$Lt_2_17922:
 //<loop> Loop body line 48, nesting depth: 1, estimated iterations: unknown
	.loc	18	53	0
	add.u64 	%rd19, %rd16, %rd18;
	mov.f32 	%f116, 0f00000000;   	// 0
	st.shared.f32 	[%rd19+0], %f116;
	add.u64 	%rd20, %rd16, %rd17;
	mov.f32 	%f117, 0f00000000;   	// 0
	st.shared.f32 	[%rd20+0], %f117;
	add.u64 	%rd21, %rd16, %rd9;
	ld.shared.f32 	%f118, [%rd21+-4];
	ld.shared.f32 	%f119, [%rd21+0];
	setp.lt.f32 	%p8, %f118, %f119;
	@!%p8 bra 	$Lt_2_24322;
 //<loop> Part of loop body line 48, head labeled $Lt_2_17922
	ld.shared.f32 	%f120, [%rd21+4];
	ld.shared.f32 	%f119, [%rd21+0];
	setp.lt.f32 	%p9, %f119, %f120;
	@!%p9 bra 	$Lt_2_24322;
 //<loop> Part of loop body line 48, head labeled $Lt_2_17922
	ld.shared.f32 	%f119, [%rd21+0];
	ld.shared.f32 	%f118, [%rd21+-4];
	.loc	18	56	0
	sub.f32 	%f121, %f119, %f118;
	.loc	18	53	0
	ld.shared.f32 	%f120, [%rd21+4];
	.loc	18	56	0
	sub.f32 	%f122, %f120, %f118;
	.loc	18	57	0
	div.full.f32 	%f123, %f121, %f122;
	mov.f32 	%f124, 0f40000000;   	// 2
	ld.shared.f32 	%f125, [%rd20+-4];
	mad.f32 	%f126, %f125, %f123, %f124;
	mov.f32 	%f127, 0f00000000;   	// 0
	setp.neu.f32 	%p10, %f126, %f127;
	@!%p10 bra 	$Lt_2_24322;
 //<loop> Part of loop body line 48, head labeled $Lt_2_17922
	.loc	18	60	0
	mov.f32 	%f128, 0fbf800000;   	// -1
	add.f32 	%f129, %f123, %f128;
	div.full.f32 	%f130, %f129, %f126;
	st.shared.f32 	[%rd20+0], %f130;
	.loc	18	61	0
	add.u64 	%rd22, %rd16, %rd12;
	ld.shared.f32 	%f131, [%rd22+0];
	ld.shared.f32 	%f132, [%rd22+4];
	sub.f32 	%f133, %f132, %f131;
	sub.f32 	%f134, %f120, %f119;
	ld.shared.f32 	%f135, [%rd22+-4];
	sub.f32 	%f136, %f131, %f135;
	div.full.f32 	%f137, %f133, %f134;
	div.full.f32 	%f138, %f136, %f121;
	sub.f32 	%f139, %f137, %f138;
	st.shared.f32 	[%rd19+0], %f139;
	.loc	18	62	0
	mov.f32 	%f140, 0f40c00000;   	// 6
	mul.f32 	%f141, %f139, %f140;
	div.full.f32 	%f142, %f141, %f122;
	ld.shared.f32 	%f143, [%rd19+-4];
	mul.f32 	%f144, %f143, %f123;
	sub.f32 	%f145, %f142, %f144;
	div.full.f32 	%f146, %f145, %f126;
	st.shared.f32 	[%rd19+0], %f146;
$Lt_2_24322:
$L_2_14338:
 //<loop> Part of loop body line 48, head labeled $Lt_2_17922
	.loc	18	56	0
	add.s32 	%r71, %r71, 1;
	add.u64 	%rd16, %rd16, 4;
	setp.ne.s32 	%p11, %r67, %r71;
	@%p11 bra 	$Lt_2_17922;
$Lt_2_17410:
	mov.u64 	%rd18, u__0;
	mov.u64 	%rd17, sPointsY2__4;
	.loc	18	69	0
	mov.f32 	%f147, 0f00000000;   	// 0
	mul.lo.u64 	%rd23, %rd14, 4;
	add.u64 	%rd24, %rd17, %rd23;
	st.shared.f32 	[%rd24+-4], %f147;
	.loc	18	72	0
	mov.s32 	%r73, %r68;
	mov.u32 	%r74, 0;
	setp.lt.s32 	%p12, %r68, %r74;
	@%p12 bra 	$Lt_2_18946;
	mov.s32 	%r75, %r67;
	cvt.u64.s32 	%rd25, %r68;
	mul.lo.u64 	%rd26, %rd25, 4;
	add.u64 	%rd27, %rd26, %rd18;
	add.u64 	%rd28, %rd26, %rd17;
	mov.s32 	%r76, %r75;
$Lt_2_19458:
 //<loop> Loop body line 72, nesting depth: 1, estimated iterations: unknown
	.loc	18	74	0
	ld.shared.f32 	%f148, [%rd27+0];
	ld.shared.f32 	%f149, [%rd28+0];
	ld.shared.f32 	%f150, [%rd28+4];
	mad.f32 	%f151, %f149, %f150, %f148;
	st.shared.f32 	[%rd28+0], %f151;
	sub.s32 	%r73, %r73, 1;
	sub.u64 	%rd28, %rd28, 4;
	sub.u64 	%rd27, %rd27, 4;
	mov.u32 	%r77, -1;
	setp.ne.s32 	%p13, %r73, %r77;
	@%p13 bra 	$Lt_2_19458;
$Lt_2_18946:
$Lt_2_15874:
	mov.u64 	%rd9, sPointsX__2;
	mov.u64 	%rd17, sPointsY2__4;
	mov.u64 	%rd12, sPointsY__3;
	.loc	19	121	0
	bar.sync 	0;
	mov.f32 	%f152, 0f3a83126f;   	// 0.001
	setp.gt.f32 	%p14, %f6, %f152;
	@!%p14 bra 	$Lt_2_19970;
	.loc	19	130	0
	mov.f32 	%f153, 0f00000000;   	// 0
	setp.lt.f32 	%p15, %f12, %f153;
	@!%p15 bra 	$Lt_2_20738;
	.loc	18	134	0
	ld.shared.f32 	%f154, [sPointsY__3+0];
	add.f32 	%f155, %f154, %f12;
	bra.uni 	$Lt_2_20994;
$Lt_2_20738:
	ld.shared.s32 	%r78, [sPointCount__1];
	cvt.u64.s32 	%rd14, %r78;
	mov.f32 	%f156, 0f3f800000;   	// 1
	setp.gt.f32 	%p16, %f12, %f156;
	@!%p16 bra 	$Lt_2_21250;
	.loc	18	138	0
	mov.f32 	%f157, 0f3f800000;   	// 1
	mul.lo.u64 	%rd29, %rd14, 4;
	add.u64 	%rd30, %rd12, %rd29;
	ld.shared.f32 	%f158, [%rd30+-4];
	sub.f32 	%f159, %f157, %f158;
	sub.f32 	%f155, %f12, %f159;
	bra.uni 	$Lt_2_20994;
$Lt_2_21250:
	.loc	18	88	0
	mov.f32 	%f160, %f12;
	.loc	18	92	0
	sub.u64 	%rd31, %rd14, 1;
	mov.s64 	%rd32, %rd31;
	mov.u64 	%rd33, 1;
	setp.le.u64 	%p17, %rd31, %rd33;
	mov.u64 	%rd34, 0;
	@%p17 bra 	$Lt_2_25090;
$Lt_2_22018:
 //<loop> Loop body line 92
	add.u64 	%rd35, %rd32, %rd34;
	shr.u64 	%rd36, %rd35, 1;
	mul.lo.u64 	%rd37, %rd36, 4;
	add.u64 	%rd38, %rd9, %rd37;
	ld.shared.f32 	%f161, [%rd38+0];
	setp.gt.f32 	%p18, %f161, %f12;
	@!%p18 bra 	$Lt_2_22530;
 //<loop> Part of loop body line 92, head labeled $Lt_2_22018
	.loc	18	101	0
	mov.s64 	%rd32, %rd36;
	bra.uni 	$Lt_2_22274;
$Lt_2_22530:
 //<loop> Part of loop body line 92, head labeled $Lt_2_22018
	.loc	18	105	0
	mov.s64 	%rd34, %rd36;
$Lt_2_22274:
 //<loop> Part of loop body line 92, head labeled $Lt_2_22018
	sub.u64 	%rd39, %rd32, %rd34;
	mov.u64 	%rd40, 1;
	setp.gt.u64 	%p19, %rd39, %rd40;
	@%p19 bra 	$Lt_2_22018;
	bra.uni 	$Lt_2_21506;
$Lt_2_25090:
$Lt_2_21506:
	.loc	18	109	0
	mul.lo.u64 	%rd41, %rd32, 4;
	mul.lo.u64 	%rd42, %rd34, 4;
	add.u64 	%rd43, %rd41, %rd9;
	add.u64 	%rd44, %rd42, %rd9;
	ld.shared.f32 	%f162, [%rd43+0];
	ld.shared.f32 	%f163, [%rd44+0];
	sub.f32 	%f164, %f162, %f163;
	mov.f32 	%f165, 0f00000000;   	// 0
	setp.neu.f32 	%p20, %f164, %f165;
	@!%p20 bra 	$Lt_2_23042;
	ld.shared.f32 	%f162, [%rd43+0];
	.loc	18	112	0
	sub.f32 	%f166, %f162, %f12;
	.loc	18	109	0
	ld.shared.f32 	%f163, [%rd44+0];
	.loc	18	113	0
	sub.f32 	%f167, %f12, %f163;
	.loc	18	114	0
	div.full.f32 	%f168, %f167, %f164;
	div.full.f32 	%f169, %f166, %f164;
	add.u64 	%rd45, %rd41, %rd17;
	ld.shared.f32 	%f170, [%rd45+0];
	mul.f32 	%f171, %f168, %f168;
	mul.f32 	%f172, %f168, %f171;
	sub.f32 	%f173, %f172, %f168;
	mul.f32 	%f174, %f170, %f173;
	add.u64 	%rd46, %rd42, %rd17;
	ld.shared.f32 	%f175, [%rd46+0];
	mul.f32 	%f176, %f169, %f169;
	mul.f32 	%f177, %f169, %f176;
	sub.f32 	%f178, %f177, %f169;
	mad.f32 	%f179, %f175, %f178, %f174;
	mul.f32 	%f180, %f164, %f164;
	mul.f32 	%f181, %f179, %f180;
	mov.f32 	%f182, 0f40c00000;   	// 6
	div.full.f32 	%f183, %f181, %f182;
	add.u64 	%rd47, %rd41, %rd12;
	ld.shared.f32 	%f184, [%rd47+0];
	mul.f32 	%f185, %f184, %f168;
	add.u64 	%rd48, %rd42, %rd12;
	ld.shared.f32 	%f186, [%rd48+0];
	mad.f32 	%f187, %f186, %f169, %f185;
	add.f32 	%f160, %f183, %f187;
$Lt_2_23042:
	.loc	18	142	0
	mov.f32 	%f155, %f160;
$Lt_2_20994:
$Lt_2_20482:
	.loc	19	131	0
	sub.f32 	%f188, %f155, %f12;
	mad.f32 	%f13, %f6, %f188, %f12;
$Lt_2_19970:
	.loc	16	100	0
	ld.const.f32 	%f189, [kRGB32f_To_601YPbPr+16];
	mul.f32 	%f190, %f189, %f2;
	ld.const.f32 	%f191, [kRGB32f_To_601YPbPr+28];
	mul.f32 	%f192, %f191, %f2;
	ld.const.f32 	%f193, [kRGB32f_To_601YPbPr+12];
	mad.f32 	%f194, %f193, %f3, %f190;
	ld.const.f32 	%f195, [kRGB32f_To_601YPbPr+24];
	mad.f32 	%f196, %f195, %f3, %f192;
	ld.const.f32 	%f197, [kRGB32f_To_601YPbPr+20];
	mad.f32 	%f198, %f197, %f1, %f194;
	ld.const.f32 	%f199, [kRGB32f_To_601YPbPr+32];
	mad.f32 	%f200, %f199, %f1, %f196;
	ld.const.f32 	%f201, [k601YPbPr_To_RGB32f+28];
	mul.f32 	%f202, %f201, %f198;
	ld.const.f32 	%f203, [k601YPbPr_To_RGB32f+24];
	mad.f32 	%f204, %f203, %f13, %f202;
	ld.const.f32 	%f205, [k601YPbPr_To_RGB32f+32];
	mad.f32 	%f206, %f205, %f200, %f204;
	ld.const.f32 	%f207, [k601YPbPr_To_RGB32f+16];
	mul.f32 	%f208, %f207, %f198;
	ld.const.f32 	%f209, [k601YPbPr_To_RGB32f+12];
	mad.f32 	%f210, %f209, %f13, %f208;
	ld.const.f32 	%f211, [k601YPbPr_To_RGB32f+20];
	mad.f32 	%f212, %f211, %f200, %f210;
	ld.const.f32 	%f213, [k601YPbPr_To_RGB32f+4];
	mul.f32 	%f214, %f213, %f198;
	ld.const.f32 	%f215, [k601YPbPr_To_RGB32f+0];
	mad.f32 	%f216, %f215, %f13, %f214;
	ld.const.f32 	%f217, [k601YPbPr_To_RGB32f+8];
	mad.f32 	%f218, %f217, %f200, %f216;
	st.global.v4.f32 	[%rd4+0], {%f206,%f212,%f218,%f4};
$Lt_2_14850:
	.loc	19	340	0
	exit;
$LDWend_LumaCurve_CompositeKernel:
	} // LumaCurve_CompositeKernel

