	.version 1.4
	.target sm_11, map_f64_to_f32
	// compiled with ../../../External/3rdParty/NVIDIA/CUDA/win/64/bin64/../open64/lib//be.exe
	// nvopencc 2.3 built on 2009-07-14

	//-----------------------------------------------------------
	// Compiling C:\Users\dvaeng\AppData\Local\Temp/tmpxft_0001da38_00000000-9_Accumulate.cpp3.i (C:/Users/dvaeng/AppData/Local/Temp/ccBI#.a21716)
	//-----------------------------------------------------------

	//-----------------------------------------------------------
	// Options:
	//-----------------------------------------------------------
	//  Target:ptx, ISA:sm_11, Endian:little, Pointer Size:64
	//  -O3	(Optimization level)
	//  -g0	(Debug level)
	//  -m2	(Report advisories)
	//-----------------------------------------------------------

	.file	1	"C:\Users\dvaeng\AppData\Local\Temp/tmpxft_0001da38_00000000-8_Accumulate.cudafe2.gpu"
	.file	2	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/PixelRGB.h"
	.file	3	"C:\Program Files (x86)\Microsoft Visual Studio 9.0\VC\include\crtdefs.h"
	.file	4	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\crt/device_runtime.h"
	.file	5	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\host_defines.h"
	.file	6	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\builtin_types.h"
	.file	7	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\device_types.h"
	.file	8	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\driver_types.h"
	.file	9	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\texture_types.h"
	.file	10	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\vector_types.h"
	.file	11	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\host_defines.h"
	.file	12	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\device_launch_parameters.h"
	.file	13	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\crt\storage_class.h"
	.file	14	"C:\Program Files (x86)\Microsoft Visual Studio 9.0\VC\include\time.h"
	.file	15	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/Utils.h"
	.file	16	"c:/scully64/shared/adobe/MediaCore/GPUFoundation/Src/ImageProcessing/Accumulate.cu"
	.file	17	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/VectorUtils.h"
	.file	18	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\common_functions.h"
	.file	19	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\crt/func_macro.h"
	.file	20	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_functions.h"
	.file	21	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\device_functions.h"
	.file	22	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_constants.h"
	.file	23	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_11_atomic_functions.h"
	.file	24	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_12_atomic_functions.h"
	.file	25	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_13_double_functions.h"
	.file	26	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\common_types.h"
	.file	27	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\texture_fetch_functions.h"
	.file	28	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_functions_dbl_ptx1.h"


	.entry AccumulateKernel (
		.param .u64 __cudaparm_AccumulateKernel_inSrc0,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch0,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights0,
		.param .u64 __cudaparm_AccumulateKernel_inSrc1,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch1,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights1,
		.param .u64 __cudaparm_AccumulateKernel_inSrc2,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch2,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights2,
		.param .u64 __cudaparm_AccumulateKernel_inSrc3,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch3,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights3,
		.param .u64 __cudaparm_AccumulateKernel_inSrc4,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch4,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights4,
		.param .u64 __cudaparm_AccumulateKernel_inSrc5,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch5,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights5,
		.param .u64 __cudaparm_AccumulateKernel_inSrc6,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch6,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights6,
		.param .u64 __cudaparm_AccumulateKernel_inSrc7,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch7,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights7,
		.param .u64 __cudaparm_AccumulateKernel_inSrc8,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch8,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights8,
		.param .u64 __cudaparm_AccumulateKernel_inSrc9,
		.param .s32 __cudaparm_AccumulateKernel_inSrcPitch9,
		.param .f32 __cudaparm_AccumulateKernel_inSrcWeights9,
		.param .u64 __cudaparm_AccumulateKernel_inDest,
		.param .s32 __cudaparm_AccumulateKernel_inDestPitch,
		.param .s32 __cudaparm_AccumulateKernel_inWidth,
		.param .s32 __cudaparm_AccumulateKernel_inHeight)
	{
	.reg .u32 %r<53>;
	.reg .u64 %rd<56>;
	.reg .f32 %f<347>;
	.reg .pred %p<47>;
	.loc	16	106	0
$LBB1_AccumulateKernel:
	.loc	16	109	0
	cvt.s32.u16 	%r1, %ctaid.x;
	cvt.s32.u16 	%r2, %ntid.x;
	mul24.lo.s32 	%r3, %r1, %r2;
	cvt.s32.u16 	%r4, %ctaid.y;
	cvt.s32.u16 	%r5, %ntid.y;
	mul24.lo.s32 	%r6, %r4, %r5;
	cvt.u32.u16 	%r7, %tid.x;
	add.u32 	%r8, %r3, %r7;
	cvt.u32.u16 	%r9, %tid.y;
	add.u32 	%r10, %r6, %r9;
	ld.param.s32 	%r11, [__cudaparm_AccumulateKernel_inWidth];
	set.gt.u32.s32 	%r12, %r11, %r8;
	neg.s32 	%r13, %r12;
	ld.param.s32 	%r14, [__cudaparm_AccumulateKernel_inHeight];
	set.gt.u32.s32 	%r15, %r14, %r10;
	neg.s32 	%r16, %r15;
	and.b32 	%r17, %r13, %r16;
	mov.u32 	%r18, 0;
	setp.eq.s32 	%p1, %r17, %r18;
	@%p1 bra 	$Lt_0_51970;
	.loc	16	115	0
	ld.param.u64 	%rd1, [__cudaparm_AccumulateKernel_inSrc0];
	mov.u64 	%rd2, 0;
	setp.eq.u64 	%p2, %rd1, %rd2;
	@%p2 bra 	$Lt_0_52738;
	.loc	15	89	0
	ld.param.s32 	%r19, [__cudaparm_AccumulateKernel_inSrcPitch0];
	mul24.lo.s32 	%r20, %r10, %r19;
	add.s32 	%r21, %r20, %r8;
	cvt.s64.s32 	%rd3, %r21;
	mul.lo.u64 	%rd4, %rd3, 16;
	add.u64 	%rd5, %rd1, %rd4;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd5+0];
	.loc	16	33	0
	mov.f32 	%f5, 0f00000000;     	// 0
	setp.lt.f32 	%p3, %f1, %f5;
	@!%p3 bra 	$Lt_0_52994;
	.loc	2	196	0
	neg.f32 	%f6, %f1;
	lg2.approx.f32 	%f7, %f6;
	mov.f32 	%f8, 0f400ccccd;     	// 2.2
	mul.f32 	%f9, %f7, %f8;
	ex2.approx.f32 	%f10, %f9;
	neg.f32 	%f11, %f10;
	bra.uni 	$Lt_0_16642;
$Lt_0_52994:
	.loc	2	198	0
	lg2.approx.f32 	%f12, %f1;
	mov.f32 	%f13, 0f400ccccd;    	// 2.2
	mul.f32 	%f14, %f12, %f13;
	ex2.approx.f32 	%f11, %f14;
$Lt_0_16642:
	.loc	16	34	0
	mov.f32 	%f15, 0f00000000;    	// 0
	setp.lt.f32 	%p4, %f2, %f15;
	@!%p4 bra 	$Lt_0_53506;
	.loc	2	196	0
	neg.f32 	%f16, %f2;
	lg2.approx.f32 	%f17, %f16;
	mov.f32 	%f18, 0f400ccccd;    	// 2.2
	mul.f32 	%f19, %f17, %f18;
	ex2.approx.f32 	%f20, %f19;
	neg.f32 	%f21, %f20;
	bra.uni 	$Lt_0_16130;
$Lt_0_53506:
	.loc	2	198	0
	lg2.approx.f32 	%f22, %f2;
	mov.f32 	%f23, 0f400ccccd;    	// 2.2
	mul.f32 	%f24, %f22, %f23;
	ex2.approx.f32 	%f21, %f24;
$Lt_0_16130:
	.loc	16	35	0
	mov.f32 	%f25, 0f00000000;    	// 0
	setp.lt.f32 	%p5, %f3, %f25;
	@!%p5 bra 	$Lt_0_54018;
	.loc	2	196	0
	neg.f32 	%f26, %f3;
	lg2.approx.f32 	%f27, %f26;
	mov.f32 	%f28, 0f400ccccd;    	// 2.2
	mul.f32 	%f29, %f27, %f28;
	ex2.approx.f32 	%f30, %f29;
	neg.f32 	%f31, %f30;
	bra.uni 	$Lt_0_15618;
$Lt_0_54018:
	.loc	2	198	0
	lg2.approx.f32 	%f32, %f3;
	mov.f32 	%f33, 0f400ccccd;    	// 2.2
	mul.f32 	%f34, %f32, %f33;
	ex2.approx.f32 	%f31, %f34;
$Lt_0_15618:
	.loc	17	80	0
	ld.param.f32 	%f35, [__cudaparm_AccumulateKernel_inSrcWeights0];
	mul.f32 	%f36, %f35, %f4;
	cvt.sat.f32.f32 	%f37, %f36;
	mul.f32 	%f38, %f11, %f37;
	.loc	17	81	0
	mul.f32 	%f39, %f21, %f37;
	.loc	17	82	0
	mul.f32 	%f40, %f31, %f37;
	.loc	17	83	0
	mov.f32 	%f41, %f37;
	.loc	16	64	0
	bra.uni 	$Lt_0_52482;
$Lt_0_52738:
	mov.f32 	%f41, 0f00000000;    	// 0
	mov.f32 	%f40, 0f00000000;    	// 0
	mov.f32 	%f39, 0f00000000;    	// 0
	mov.f32 	%f38, 0f00000000;    	// 0
$Lt_0_52482:
	.loc	16	116	0
	ld.param.u64 	%rd6, [__cudaparm_AccumulateKernel_inSrc1];
	mov.u64 	%rd7, 0;
	setp.eq.u64 	%p6, %rd6, %rd7;
	@%p6 bra 	$Lt_0_54530;
	.loc	15	89	0
	ld.param.s32 	%r22, [__cudaparm_AccumulateKernel_inSrcPitch1];
	mul24.lo.s32 	%r23, %r10, %r22;
	add.s32 	%r24, %r23, %r8;
	cvt.s64.s32 	%rd8, %r24;
	mul.lo.u64 	%rd9, %rd8, 16;
	add.u64 	%rd10, %rd6, %rd9;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd10+0];
	.loc	16	33	0
	mov.f32 	%f42, 0f00000000;    	// 0
	setp.lt.f32 	%p7, %f1, %f42;
	@!%p7 bra 	$Lt_0_55042;
	.loc	2	196	0
	neg.f32 	%f43, %f1;
	lg2.approx.f32 	%f44, %f43;
	mov.f32 	%f45, 0f400ccccd;    	// 2.2
	mul.f32 	%f46, %f44, %f45;
	ex2.approx.f32 	%f47, %f46;
	neg.f32 	%f11, %f47;
	bra.uni 	$Lt_0_15106;
$Lt_0_55042:
	.loc	2	198	0
	lg2.approx.f32 	%f48, %f1;
	mov.f32 	%f49, 0f400ccccd;    	// 2.2
	mul.f32 	%f50, %f48, %f49;
	ex2.approx.f32 	%f11, %f50;
$Lt_0_15106:
	.loc	16	34	0
	mov.f32 	%f51, 0f00000000;    	// 0
	setp.lt.f32 	%p8, %f2, %f51;
	@!%p8 bra 	$Lt_0_55554;
	.loc	2	196	0
	neg.f32 	%f52, %f2;
	lg2.approx.f32 	%f53, %f52;
	mov.f32 	%f54, 0f400ccccd;    	// 2.2
	mul.f32 	%f55, %f53, %f54;
	ex2.approx.f32 	%f56, %f55;
	neg.f32 	%f21, %f56;
	bra.uni 	$Lt_0_14594;
$Lt_0_55554:
	.loc	2	198	0
	lg2.approx.f32 	%f57, %f2;
	mov.f32 	%f58, 0f400ccccd;    	// 2.2
	mul.f32 	%f59, %f57, %f58;
	ex2.approx.f32 	%f21, %f59;
$Lt_0_14594:
	.loc	16	35	0
	mov.f32 	%f60, 0f00000000;    	// 0
	setp.lt.f32 	%p9, %f3, %f60;
	@!%p9 bra 	$Lt_0_56066;
	.loc	2	196	0
	neg.f32 	%f61, %f3;
	lg2.approx.f32 	%f62, %f61;
	mov.f32 	%f63, 0f400ccccd;    	// 2.2
	mul.f32 	%f64, %f62, %f63;
	ex2.approx.f32 	%f65, %f64;
	neg.f32 	%f31, %f65;
	bra.uni 	$Lt_0_14082;
$Lt_0_56066:
	.loc	2	198	0
	lg2.approx.f32 	%f66, %f3;
	mov.f32 	%f67, 0f400ccccd;    	// 2.2
	mul.f32 	%f68, %f66, %f67;
	ex2.approx.f32 	%f31, %f68;
$Lt_0_14082:
	.loc	17	80	0
	ld.param.f32 	%f69, [__cudaparm_AccumulateKernel_inSrcWeights1];
	mul.f32 	%f70, %f69, %f4;
	cvt.sat.f32.f32 	%f71, %f70;
	mad.f32 	%f38, %f11, %f71, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f71, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f71, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f71, %f41;
$Lt_0_54530:
	.loc	16	117	0
	ld.param.u64 	%rd11, [__cudaparm_AccumulateKernel_inSrc2];
	mov.u64 	%rd12, 0;
	setp.eq.u64 	%p10, %rd11, %rd12;
	@%p10 bra 	$Lt_0_56578;
	.loc	15	89	0
	ld.param.s32 	%r25, [__cudaparm_AccumulateKernel_inSrcPitch2];
	mul24.lo.s32 	%r26, %r10, %r25;
	add.s32 	%r27, %r26, %r8;
	cvt.s64.s32 	%rd13, %r27;
	mul.lo.u64 	%rd14, %rd13, 16;
	add.u64 	%rd15, %rd11, %rd14;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd15+0];
	.loc	16	33	0
	mov.f32 	%f72, 0f00000000;    	// 0
	setp.lt.f32 	%p11, %f1, %f72;
	@!%p11 bra 	$Lt_0_57090;
	.loc	2	196	0
	neg.f32 	%f73, %f1;
	lg2.approx.f32 	%f74, %f73;
	mov.f32 	%f75, 0f400ccccd;    	// 2.2
	mul.f32 	%f76, %f74, %f75;
	ex2.approx.f32 	%f77, %f76;
	neg.f32 	%f11, %f77;
	bra.uni 	$Lt_0_13570;
$Lt_0_57090:
	.loc	2	198	0
	lg2.approx.f32 	%f78, %f1;
	mov.f32 	%f79, 0f400ccccd;    	// 2.2
	mul.f32 	%f80, %f78, %f79;
	ex2.approx.f32 	%f11, %f80;
$Lt_0_13570:
	.loc	16	34	0
	mov.f32 	%f81, 0f00000000;    	// 0
	setp.lt.f32 	%p12, %f2, %f81;
	@!%p12 bra 	$Lt_0_57602;
	.loc	2	196	0
	neg.f32 	%f82, %f2;
	lg2.approx.f32 	%f83, %f82;
	mov.f32 	%f84, 0f400ccccd;    	// 2.2
	mul.f32 	%f85, %f83, %f84;
	ex2.approx.f32 	%f86, %f85;
	neg.f32 	%f21, %f86;
	bra.uni 	$Lt_0_13058;
$Lt_0_57602:
	.loc	2	198	0
	lg2.approx.f32 	%f87, %f2;
	mov.f32 	%f88, 0f400ccccd;    	// 2.2
	mul.f32 	%f89, %f87, %f88;
	ex2.approx.f32 	%f21, %f89;
$Lt_0_13058:
	.loc	16	35	0
	mov.f32 	%f90, 0f00000000;    	// 0
	setp.lt.f32 	%p13, %f3, %f90;
	@!%p13 bra 	$Lt_0_58114;
	.loc	2	196	0
	neg.f32 	%f91, %f3;
	lg2.approx.f32 	%f92, %f91;
	mov.f32 	%f93, 0f400ccccd;    	// 2.2
	mul.f32 	%f94, %f92, %f93;
	ex2.approx.f32 	%f95, %f94;
	neg.f32 	%f31, %f95;
	bra.uni 	$Lt_0_12546;
$Lt_0_58114:
	.loc	2	198	0
	lg2.approx.f32 	%f96, %f3;
	mov.f32 	%f97, 0f400ccccd;    	// 2.2
	mul.f32 	%f98, %f96, %f97;
	ex2.approx.f32 	%f31, %f98;
$Lt_0_12546:
	.loc	17	80	0
	ld.param.f32 	%f99, [__cudaparm_AccumulateKernel_inSrcWeights2];
	mul.f32 	%f100, %f99, %f4;
	cvt.sat.f32.f32 	%f101, %f100;
	mad.f32 	%f38, %f11, %f101, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f101, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f101, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f101, %f41;
$Lt_0_56578:
	.loc	16	118	0
	ld.param.u64 	%rd16, [__cudaparm_AccumulateKernel_inSrc3];
	mov.u64 	%rd17, 0;
	setp.eq.u64 	%p14, %rd16, %rd17;
	@%p14 bra 	$Lt_0_58626;
	.loc	15	89	0
	ld.param.s32 	%r28, [__cudaparm_AccumulateKernel_inSrcPitch3];
	mul24.lo.s32 	%r29, %r10, %r28;
	add.s32 	%r30, %r29, %r8;
	cvt.s64.s32 	%rd18, %r30;
	mul.lo.u64 	%rd19, %rd18, 16;
	add.u64 	%rd20, %rd16, %rd19;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd20+0];
	.loc	16	33	0
	mov.f32 	%f102, 0f00000000;   	// 0
	setp.lt.f32 	%p15, %f1, %f102;
	@!%p15 bra 	$Lt_0_59138;
	.loc	2	196	0
	neg.f32 	%f103, %f1;
	lg2.approx.f32 	%f104, %f103;
	mov.f32 	%f105, 0f400ccccd;   	// 2.2
	mul.f32 	%f106, %f104, %f105;
	ex2.approx.f32 	%f107, %f106;
	neg.f32 	%f11, %f107;
	bra.uni 	$Lt_0_12034;
$Lt_0_59138:
	.loc	2	198	0
	lg2.approx.f32 	%f108, %f1;
	mov.f32 	%f109, 0f400ccccd;   	// 2.2
	mul.f32 	%f110, %f108, %f109;
	ex2.approx.f32 	%f11, %f110;
$Lt_0_12034:
	.loc	16	34	0
	mov.f32 	%f111, 0f00000000;   	// 0
	setp.lt.f32 	%p16, %f2, %f111;
	@!%p16 bra 	$Lt_0_59650;
	.loc	2	196	0
	neg.f32 	%f112, %f2;
	lg2.approx.f32 	%f113, %f112;
	mov.f32 	%f114, 0f400ccccd;   	// 2.2
	mul.f32 	%f115, %f113, %f114;
	ex2.approx.f32 	%f116, %f115;
	neg.f32 	%f21, %f116;
	bra.uni 	$Lt_0_11522;
$Lt_0_59650:
	.loc	2	198	0
	lg2.approx.f32 	%f117, %f2;
	mov.f32 	%f118, 0f400ccccd;   	// 2.2
	mul.f32 	%f119, %f117, %f118;
	ex2.approx.f32 	%f21, %f119;
$Lt_0_11522:
	.loc	16	35	0
	mov.f32 	%f120, 0f00000000;   	// 0
	setp.lt.f32 	%p17, %f3, %f120;
	@!%p17 bra 	$Lt_0_60162;
	.loc	2	196	0
	neg.f32 	%f121, %f3;
	lg2.approx.f32 	%f122, %f121;
	mov.f32 	%f123, 0f400ccccd;   	// 2.2
	mul.f32 	%f124, %f122, %f123;
	ex2.approx.f32 	%f125, %f124;
	neg.f32 	%f31, %f125;
	bra.uni 	$Lt_0_11010;
$Lt_0_60162:
	.loc	2	198	0
	lg2.approx.f32 	%f126, %f3;
	mov.f32 	%f127, 0f400ccccd;   	// 2.2
	mul.f32 	%f128, %f126, %f127;
	ex2.approx.f32 	%f31, %f128;
$Lt_0_11010:
	.loc	17	80	0
	ld.param.f32 	%f129, [__cudaparm_AccumulateKernel_inSrcWeights3];
	mul.f32 	%f130, %f129, %f4;
	cvt.sat.f32.f32 	%f131, %f130;
	mad.f32 	%f38, %f11, %f131, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f131, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f131, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f131, %f41;
$Lt_0_58626:
	.loc	16	119	0
	ld.param.u64 	%rd21, [__cudaparm_AccumulateKernel_inSrc4];
	mov.u64 	%rd22, 0;
	setp.eq.u64 	%p18, %rd21, %rd22;
	@%p18 bra 	$Lt_0_60674;
	.loc	15	89	0
	ld.param.s32 	%r31, [__cudaparm_AccumulateKernel_inSrcPitch4];
	mul24.lo.s32 	%r32, %r10, %r31;
	add.s32 	%r33, %r32, %r8;
	cvt.s64.s32 	%rd23, %r33;
	mul.lo.u64 	%rd24, %rd23, 16;
	add.u64 	%rd25, %rd21, %rd24;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd25+0];
	.loc	16	33	0
	mov.f32 	%f132, 0f00000000;   	// 0
	setp.lt.f32 	%p19, %f1, %f132;
	@!%p19 bra 	$Lt_0_61186;
	.loc	2	196	0
	neg.f32 	%f133, %f1;
	lg2.approx.f32 	%f134, %f133;
	mov.f32 	%f135, 0f400ccccd;   	// 2.2
	mul.f32 	%f136, %f134, %f135;
	ex2.approx.f32 	%f137, %f136;
	neg.f32 	%f11, %f137;
	bra.uni 	$Lt_0_10498;
$Lt_0_61186:
	.loc	2	198	0
	lg2.approx.f32 	%f138, %f1;
	mov.f32 	%f139, 0f400ccccd;   	// 2.2
	mul.f32 	%f140, %f138, %f139;
	ex2.approx.f32 	%f11, %f140;
$Lt_0_10498:
	.loc	16	34	0
	mov.f32 	%f141, 0f00000000;   	// 0
	setp.lt.f32 	%p20, %f2, %f141;
	@!%p20 bra 	$Lt_0_61698;
	.loc	2	196	0
	neg.f32 	%f142, %f2;
	lg2.approx.f32 	%f143, %f142;
	mov.f32 	%f144, 0f400ccccd;   	// 2.2
	mul.f32 	%f145, %f143, %f144;
	ex2.approx.f32 	%f146, %f145;
	neg.f32 	%f21, %f146;
	bra.uni 	$Lt_0_9986;
$Lt_0_61698:
	.loc	2	198	0
	lg2.approx.f32 	%f147, %f2;
	mov.f32 	%f148, 0f400ccccd;   	// 2.2
	mul.f32 	%f149, %f147, %f148;
	ex2.approx.f32 	%f21, %f149;
$Lt_0_9986:
	.loc	16	35	0
	mov.f32 	%f150, 0f00000000;   	// 0
	setp.lt.f32 	%p21, %f3, %f150;
	@!%p21 bra 	$Lt_0_62210;
	.loc	2	196	0
	neg.f32 	%f151, %f3;
	lg2.approx.f32 	%f152, %f151;
	mov.f32 	%f153, 0f400ccccd;   	// 2.2
	mul.f32 	%f154, %f152, %f153;
	ex2.approx.f32 	%f155, %f154;
	neg.f32 	%f31, %f155;
	bra.uni 	$Lt_0_9474;
$Lt_0_62210:
	.loc	2	198	0
	lg2.approx.f32 	%f156, %f3;
	mov.f32 	%f157, 0f400ccccd;   	// 2.2
	mul.f32 	%f158, %f156, %f157;
	ex2.approx.f32 	%f31, %f158;
$Lt_0_9474:
	.loc	17	80	0
	ld.param.f32 	%f159, [__cudaparm_AccumulateKernel_inSrcWeights4];
	mul.f32 	%f160, %f159, %f4;
	cvt.sat.f32.f32 	%f161, %f160;
	mad.f32 	%f38, %f11, %f161, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f161, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f161, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f161, %f41;
$Lt_0_60674:
	.loc	16	120	0
	ld.param.u64 	%rd26, [__cudaparm_AccumulateKernel_inSrc5];
	mov.u64 	%rd27, 0;
	setp.eq.u64 	%p22, %rd26, %rd27;
	@%p22 bra 	$Lt_0_62722;
	.loc	15	89	0
	ld.param.s32 	%r34, [__cudaparm_AccumulateKernel_inSrcPitch5];
	mul24.lo.s32 	%r35, %r10, %r34;
	add.s32 	%r36, %r35, %r8;
	cvt.s64.s32 	%rd28, %r36;
	mul.lo.u64 	%rd29, %rd28, 16;
	add.u64 	%rd30, %rd26, %rd29;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd30+0];
	.loc	16	33	0
	mov.f32 	%f162, 0f00000000;   	// 0
	setp.lt.f32 	%p23, %f1, %f162;
	@!%p23 bra 	$Lt_0_63234;
	.loc	2	196	0
	neg.f32 	%f163, %f1;
	lg2.approx.f32 	%f164, %f163;
	mov.f32 	%f165, 0f400ccccd;   	// 2.2
	mul.f32 	%f166, %f164, %f165;
	ex2.approx.f32 	%f167, %f166;
	neg.f32 	%f11, %f167;
	bra.uni 	$Lt_0_8962;
$Lt_0_63234:
	.loc	2	198	0
	lg2.approx.f32 	%f168, %f1;
	mov.f32 	%f169, 0f400ccccd;   	// 2.2
	mul.f32 	%f170, %f168, %f169;
	ex2.approx.f32 	%f11, %f170;
$Lt_0_8962:
	.loc	16	34	0
	mov.f32 	%f171, 0f00000000;   	// 0
	setp.lt.f32 	%p24, %f2, %f171;
	@!%p24 bra 	$Lt_0_63746;
	.loc	2	196	0
	neg.f32 	%f172, %f2;
	lg2.approx.f32 	%f173, %f172;
	mov.f32 	%f174, 0f400ccccd;   	// 2.2
	mul.f32 	%f175, %f173, %f174;
	ex2.approx.f32 	%f176, %f175;
	neg.f32 	%f21, %f176;
	bra.uni 	$Lt_0_8450;
$Lt_0_63746:
	.loc	2	198	0
	lg2.approx.f32 	%f177, %f2;
	mov.f32 	%f178, 0f400ccccd;   	// 2.2
	mul.f32 	%f179, %f177, %f178;
	ex2.approx.f32 	%f21, %f179;
$Lt_0_8450:
	.loc	16	35	0
	mov.f32 	%f180, 0f00000000;   	// 0
	setp.lt.f32 	%p25, %f3, %f180;
	@!%p25 bra 	$Lt_0_64258;
	.loc	2	196	0
	neg.f32 	%f181, %f3;
	lg2.approx.f32 	%f182, %f181;
	mov.f32 	%f183, 0f400ccccd;   	// 2.2
	mul.f32 	%f184, %f182, %f183;
	ex2.approx.f32 	%f185, %f184;
	neg.f32 	%f31, %f185;
	bra.uni 	$Lt_0_7938;
$Lt_0_64258:
	.loc	2	198	0
	lg2.approx.f32 	%f186, %f3;
	mov.f32 	%f187, 0f400ccccd;   	// 2.2
	mul.f32 	%f188, %f186, %f187;
	ex2.approx.f32 	%f31, %f188;
$Lt_0_7938:
	.loc	17	80	0
	ld.param.f32 	%f189, [__cudaparm_AccumulateKernel_inSrcWeights5];
	mul.f32 	%f190, %f189, %f4;
	cvt.sat.f32.f32 	%f191, %f190;
	mad.f32 	%f38, %f11, %f191, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f191, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f191, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f191, %f41;
$Lt_0_62722:
	.loc	16	121	0
	ld.param.u64 	%rd31, [__cudaparm_AccumulateKernel_inSrc6];
	mov.u64 	%rd32, 0;
	setp.eq.u64 	%p26, %rd31, %rd32;
	@%p26 bra 	$Lt_0_64770;
	.loc	15	89	0
	ld.param.s32 	%r37, [__cudaparm_AccumulateKernel_inSrcPitch6];
	mul24.lo.s32 	%r38, %r10, %r37;
	add.s32 	%r39, %r38, %r8;
	cvt.s64.s32 	%rd33, %r39;
	mul.lo.u64 	%rd34, %rd33, 16;
	add.u64 	%rd35, %rd31, %rd34;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd35+0];
	.loc	16	33	0
	mov.f32 	%f192, 0f00000000;   	// 0
	setp.lt.f32 	%p27, %f1, %f192;
	@!%p27 bra 	$Lt_0_65282;
	.loc	2	196	0
	neg.f32 	%f193, %f1;
	lg2.approx.f32 	%f194, %f193;
	mov.f32 	%f195, 0f400ccccd;   	// 2.2
	mul.f32 	%f196, %f194, %f195;
	ex2.approx.f32 	%f197, %f196;
	neg.f32 	%f11, %f197;
	bra.uni 	$Lt_0_7426;
$Lt_0_65282:
	.loc	2	198	0
	lg2.approx.f32 	%f198, %f1;
	mov.f32 	%f199, 0f400ccccd;   	// 2.2
	mul.f32 	%f200, %f198, %f199;
	ex2.approx.f32 	%f11, %f200;
$Lt_0_7426:
	.loc	16	34	0
	mov.f32 	%f201, 0f00000000;   	// 0
	setp.lt.f32 	%p28, %f2, %f201;
	@!%p28 bra 	$Lt_0_65794;
	.loc	2	196	0
	neg.f32 	%f202, %f2;
	lg2.approx.f32 	%f203, %f202;
	mov.f32 	%f204, 0f400ccccd;   	// 2.2
	mul.f32 	%f205, %f203, %f204;
	ex2.approx.f32 	%f206, %f205;
	neg.f32 	%f21, %f206;
	bra.uni 	$Lt_0_6914;
$Lt_0_65794:
	.loc	2	198	0
	lg2.approx.f32 	%f207, %f2;
	mov.f32 	%f208, 0f400ccccd;   	// 2.2
	mul.f32 	%f209, %f207, %f208;
	ex2.approx.f32 	%f21, %f209;
$Lt_0_6914:
	.loc	16	35	0
	mov.f32 	%f210, 0f00000000;   	// 0
	setp.lt.f32 	%p29, %f3, %f210;
	@!%p29 bra 	$Lt_0_66306;
	.loc	2	196	0
	neg.f32 	%f211, %f3;
	lg2.approx.f32 	%f212, %f211;
	mov.f32 	%f213, 0f400ccccd;   	// 2.2
	mul.f32 	%f214, %f212, %f213;
	ex2.approx.f32 	%f215, %f214;
	neg.f32 	%f31, %f215;
	bra.uni 	$Lt_0_6402;
$Lt_0_66306:
	.loc	2	198	0
	lg2.approx.f32 	%f216, %f3;
	mov.f32 	%f217, 0f400ccccd;   	// 2.2
	mul.f32 	%f218, %f216, %f217;
	ex2.approx.f32 	%f31, %f218;
$Lt_0_6402:
	.loc	17	80	0
	ld.param.f32 	%f219, [__cudaparm_AccumulateKernel_inSrcWeights6];
	mul.f32 	%f220, %f219, %f4;
	cvt.sat.f32.f32 	%f221, %f220;
	mad.f32 	%f38, %f11, %f221, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f221, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f221, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f221, %f41;
$Lt_0_64770:
	.loc	16	122	0
	ld.param.u64 	%rd36, [__cudaparm_AccumulateKernel_inSrc7];
	mov.u64 	%rd37, 0;
	setp.eq.u64 	%p30, %rd36, %rd37;
	@%p30 bra 	$Lt_0_66818;
	.loc	15	89	0
	ld.param.s32 	%r40, [__cudaparm_AccumulateKernel_inSrcPitch7];
	mul24.lo.s32 	%r41, %r10, %r40;
	add.s32 	%r42, %r41, %r8;
	cvt.s64.s32 	%rd38, %r42;
	mul.lo.u64 	%rd39, %rd38, 16;
	add.u64 	%rd40, %rd36, %rd39;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd40+0];
	.loc	16	33	0
	mov.f32 	%f222, 0f00000000;   	// 0
	setp.lt.f32 	%p31, %f1, %f222;
	@!%p31 bra 	$Lt_0_67330;
	.loc	2	196	0
	neg.f32 	%f223, %f1;
	lg2.approx.f32 	%f224, %f223;
	mov.f32 	%f225, 0f400ccccd;   	// 2.2
	mul.f32 	%f226, %f224, %f225;
	ex2.approx.f32 	%f227, %f226;
	neg.f32 	%f11, %f227;
	bra.uni 	$Lt_0_5890;
$Lt_0_67330:
	.loc	2	198	0
	lg2.approx.f32 	%f228, %f1;
	mov.f32 	%f229, 0f400ccccd;   	// 2.2
	mul.f32 	%f230, %f228, %f229;
	ex2.approx.f32 	%f11, %f230;
$Lt_0_5890:
	.loc	16	34	0
	mov.f32 	%f231, 0f00000000;   	// 0
	setp.lt.f32 	%p32, %f2, %f231;
	@!%p32 bra 	$Lt_0_67842;
	.loc	2	196	0
	neg.f32 	%f232, %f2;
	lg2.approx.f32 	%f233, %f232;
	mov.f32 	%f234, 0f400ccccd;   	// 2.2
	mul.f32 	%f235, %f233, %f234;
	ex2.approx.f32 	%f236, %f235;
	neg.f32 	%f21, %f236;
	bra.uni 	$Lt_0_5378;
$Lt_0_67842:
	.loc	2	198	0
	lg2.approx.f32 	%f237, %f2;
	mov.f32 	%f238, 0f400ccccd;   	// 2.2
	mul.f32 	%f239, %f237, %f238;
	ex2.approx.f32 	%f21, %f239;
$Lt_0_5378:
	.loc	16	35	0
	mov.f32 	%f240, 0f00000000;   	// 0
	setp.lt.f32 	%p33, %f3, %f240;
	@!%p33 bra 	$Lt_0_68354;
	.loc	2	196	0
	neg.f32 	%f241, %f3;
	lg2.approx.f32 	%f242, %f241;
	mov.f32 	%f243, 0f400ccccd;   	// 2.2
	mul.f32 	%f244, %f242, %f243;
	ex2.approx.f32 	%f245, %f244;
	neg.f32 	%f31, %f245;
	bra.uni 	$Lt_0_4866;
$Lt_0_68354:
	.loc	2	198	0
	lg2.approx.f32 	%f246, %f3;
	mov.f32 	%f247, 0f400ccccd;   	// 2.2
	mul.f32 	%f248, %f246, %f247;
	ex2.approx.f32 	%f31, %f248;
$Lt_0_4866:
	.loc	17	80	0
	ld.param.f32 	%f249, [__cudaparm_AccumulateKernel_inSrcWeights7];
	mul.f32 	%f250, %f249, %f4;
	cvt.sat.f32.f32 	%f251, %f250;
	mad.f32 	%f38, %f11, %f251, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f251, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f251, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f251, %f41;
$Lt_0_66818:
	.loc	16	123	0
	ld.param.u64 	%rd41, [__cudaparm_AccumulateKernel_inSrc8];
	mov.u64 	%rd42, 0;
	setp.eq.u64 	%p34, %rd41, %rd42;
	@%p34 bra 	$Lt_0_68866;
	.loc	15	89	0
	ld.param.s32 	%r43, [__cudaparm_AccumulateKernel_inSrcPitch8];
	mul24.lo.s32 	%r44, %r10, %r43;
	add.s32 	%r45, %r44, %r8;
	cvt.s64.s32 	%rd43, %r45;
	mul.lo.u64 	%rd44, %rd43, 16;
	add.u64 	%rd45, %rd41, %rd44;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd45+0];
	.loc	16	33	0
	mov.f32 	%f252, 0f00000000;   	// 0
	setp.lt.f32 	%p35, %f1, %f252;
	@!%p35 bra 	$Lt_0_69378;
	.loc	2	196	0
	neg.f32 	%f253, %f1;
	lg2.approx.f32 	%f254, %f253;
	mov.f32 	%f255, 0f400ccccd;   	// 2.2
	mul.f32 	%f256, %f254, %f255;
	ex2.approx.f32 	%f257, %f256;
	neg.f32 	%f11, %f257;
	bra.uni 	$Lt_0_4354;
$Lt_0_69378:
	.loc	2	198	0
	lg2.approx.f32 	%f258, %f1;
	mov.f32 	%f259, 0f400ccccd;   	// 2.2
	mul.f32 	%f260, %f258, %f259;
	ex2.approx.f32 	%f11, %f260;
$Lt_0_4354:
	.loc	16	34	0
	mov.f32 	%f261, 0f00000000;   	// 0
	setp.lt.f32 	%p36, %f2, %f261;
	@!%p36 bra 	$Lt_0_69890;
	.loc	2	196	0
	neg.f32 	%f262, %f2;
	lg2.approx.f32 	%f263, %f262;
	mov.f32 	%f264, 0f400ccccd;   	// 2.2
	mul.f32 	%f265, %f263, %f264;
	ex2.approx.f32 	%f266, %f265;
	neg.f32 	%f21, %f266;
	bra.uni 	$Lt_0_3842;
$Lt_0_69890:
	.loc	2	198	0
	lg2.approx.f32 	%f267, %f2;
	mov.f32 	%f268, 0f400ccccd;   	// 2.2
	mul.f32 	%f269, %f267, %f268;
	ex2.approx.f32 	%f21, %f269;
$Lt_0_3842:
	.loc	16	35	0
	mov.f32 	%f270, 0f00000000;   	// 0
	setp.lt.f32 	%p37, %f3, %f270;
	@!%p37 bra 	$Lt_0_70402;
	.loc	2	196	0
	neg.f32 	%f271, %f3;
	lg2.approx.f32 	%f272, %f271;
	mov.f32 	%f273, 0f400ccccd;   	// 2.2
	mul.f32 	%f274, %f272, %f273;
	ex2.approx.f32 	%f275, %f274;
	neg.f32 	%f31, %f275;
	bra.uni 	$Lt_0_3330;
$Lt_0_70402:
	.loc	2	198	0
	lg2.approx.f32 	%f276, %f3;
	mov.f32 	%f277, 0f400ccccd;   	// 2.2
	mul.f32 	%f278, %f276, %f277;
	ex2.approx.f32 	%f31, %f278;
$Lt_0_3330:
	.loc	17	80	0
	ld.param.f32 	%f279, [__cudaparm_AccumulateKernel_inSrcWeights8];
	mul.f32 	%f280, %f279, %f4;
	cvt.sat.f32.f32 	%f281, %f280;
	mad.f32 	%f38, %f11, %f281, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f281, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f281, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f281, %f41;
$Lt_0_68866:
	.loc	16	124	0
	ld.param.u64 	%rd46, [__cudaparm_AccumulateKernel_inSrc9];
	mov.u64 	%rd47, 0;
	setp.eq.u64 	%p38, %rd46, %rd47;
	@%p38 bra 	$Lt_0_70914;
	.loc	15	89	0
	ld.param.s32 	%r46, [__cudaparm_AccumulateKernel_inSrcPitch9];
	mul24.lo.s32 	%r47, %r10, %r46;
	add.s32 	%r48, %r47, %r8;
	cvt.s64.s32 	%rd48, %r48;
	mul.lo.u64 	%rd49, %rd48, 16;
	add.u64 	%rd50, %rd46, %rd49;
	ld.global.v4.f32 	{%f1,%f2,%f3,%f4}, [%rd50+0];
	.loc	16	33	0
	mov.f32 	%f282, 0f00000000;   	// 0
	setp.lt.f32 	%p39, %f1, %f282;
	@!%p39 bra 	$Lt_0_71426;
	.loc	2	196	0
	neg.f32 	%f283, %f1;
	lg2.approx.f32 	%f284, %f283;
	mov.f32 	%f285, 0f400ccccd;   	// 2.2
	mul.f32 	%f286, %f284, %f285;
	ex2.approx.f32 	%f287, %f286;
	neg.f32 	%f11, %f287;
	bra.uni 	$Lt_0_2818;
$Lt_0_71426:
	.loc	2	198	0
	lg2.approx.f32 	%f288, %f1;
	mov.f32 	%f289, 0f400ccccd;   	// 2.2
	mul.f32 	%f290, %f288, %f289;
	ex2.approx.f32 	%f11, %f290;
$Lt_0_2818:
	.loc	16	34	0
	mov.f32 	%f291, 0f00000000;   	// 0
	setp.lt.f32 	%p40, %f2, %f291;
	@!%p40 bra 	$Lt_0_71938;
	.loc	2	196	0
	neg.f32 	%f292, %f2;
	lg2.approx.f32 	%f293, %f292;
	mov.f32 	%f294, 0f400ccccd;   	// 2.2
	mul.f32 	%f295, %f293, %f294;
	ex2.approx.f32 	%f296, %f295;
	neg.f32 	%f21, %f296;
	bra.uni 	$Lt_0_2306;
$Lt_0_71938:
	.loc	2	198	0
	lg2.approx.f32 	%f297, %f2;
	mov.f32 	%f298, 0f400ccccd;   	// 2.2
	mul.f32 	%f299, %f297, %f298;
	ex2.approx.f32 	%f21, %f299;
$Lt_0_2306:
	.loc	16	35	0
	mov.f32 	%f300, 0f00000000;   	// 0
	setp.lt.f32 	%p41, %f3, %f300;
	@!%p41 bra 	$Lt_0_72450;
	.loc	2	196	0
	neg.f32 	%f301, %f3;
	lg2.approx.f32 	%f302, %f301;
	mov.f32 	%f303, 0f400ccccd;   	// 2.2
	mul.f32 	%f304, %f302, %f303;
	ex2.approx.f32 	%f305, %f304;
	neg.f32 	%f31, %f305;
	bra.uni 	$Lt_0_1794;
$Lt_0_72450:
	.loc	2	198	0
	lg2.approx.f32 	%f306, %f3;
	mov.f32 	%f307, 0f400ccccd;   	// 2.2
	mul.f32 	%f308, %f306, %f307;
	ex2.approx.f32 	%f31, %f308;
$Lt_0_1794:
	.loc	17	80	0
	ld.param.f32 	%f309, [__cudaparm_AccumulateKernel_inSrcWeights9];
	mul.f32 	%f310, %f309, %f4;
	cvt.sat.f32.f32 	%f311, %f310;
	mad.f32 	%f38, %f11, %f311, %f38;
	.loc	17	81	0
	mad.f32 	%f39, %f21, %f311, %f39;
	.loc	17	82	0
	mad.f32 	%f40, %f31, %f311, %f40;
	.loc	17	83	0
	add.f32 	%f41, %f311, %f41;
$Lt_0_70914:
	.loc	16	42	0
	mov.f32 	%f312, %f38;
	mov.f32 	%f313, %f39;
	mov.f32 	%f314, %f40;
	mov.f32 	%f315, 0f00000000;   	// 0
	setp.neu.f32 	%p42, %f41, %f315;
	@!%p42 bra 	$Lt_0_72962;
	div.full.f32 	%f314, %f314, %f41;
	div.full.f32 	%f313, %f313, %f41;
	div.full.f32 	%f312, %f312, %f41;
$Lt_0_72962:
	.loc	16	43	0
	mov.f32 	%f316, 0f00000000;   	// 0
	setp.lt.f32 	%p43, %f312, %f316;
	@!%p43 bra 	$Lt_0_73474;
	.loc	2	204	0
	neg.f32 	%f317, %f312;
	lg2.approx.f32 	%f318, %f317;
	mov.f32 	%f319, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f320, %f318, %f319;
	ex2.approx.f32 	%f321, %f320;
	neg.f32 	%f322, %f321;
	bra.uni 	$Lt_0_1282;
$Lt_0_73474:
	.loc	2	206	0
	lg2.approx.f32 	%f323, %f312;
	mov.f32 	%f324, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f325, %f323, %f324;
	ex2.approx.f32 	%f322, %f325;
$Lt_0_1282:
	.loc	16	44	0
	mov.f32 	%f326, 0f00000000;   	// 0
	setp.lt.f32 	%p44, %f313, %f326;
	@!%p44 bra 	$Lt_0_73986;
	.loc	2	204	0
	neg.f32 	%f327, %f313;
	lg2.approx.f32 	%f328, %f327;
	mov.f32 	%f329, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f330, %f328, %f329;
	ex2.approx.f32 	%f331, %f330;
	neg.f32 	%f332, %f331;
	bra.uni 	$Lt_0_770;
$Lt_0_73986:
	.loc	2	206	0
	lg2.approx.f32 	%f333, %f313;
	mov.f32 	%f334, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f335, %f333, %f334;
	ex2.approx.f32 	%f332, %f335;
$Lt_0_770:
	.loc	16	45	0
	mov.f32 	%f336, 0f00000000;   	// 0
	setp.lt.f32 	%p45, %f314, %f336;
	@!%p45 bra 	$Lt_0_74498;
	.loc	2	204	0
	neg.f32 	%f337, %f314;
	lg2.approx.f32 	%f338, %f337;
	mov.f32 	%f339, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f340, %f338, %f339;
	ex2.approx.f32 	%f341, %f340;
	neg.f32 	%f342, %f341;
	bra.uni 	$Lt_0_258;
$Lt_0_74498:
	.loc	2	206	0
	lg2.approx.f32 	%f343, %f314;
	mov.f32 	%f344, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f345, %f343, %f344;
	ex2.approx.f32 	%f342, %f345;
$Lt_0_258:
	.loc	15	100	0
	ld.param.s32 	%r49, [__cudaparm_AccumulateKernel_inDestPitch];
	mul24.lo.s32 	%r50, %r10, %r49;
	ld.param.u64 	%rd51, [__cudaparm_AccumulateKernel_inDest];
	add.s32 	%r51, %r50, %r8;
	cvt.s64.s32 	%rd52, %r51;
	mul.lo.u64 	%rd53, %rd52, 16;
	add.u64 	%rd54, %rd51, %rd53;
	st.global.v4.f32 	[%rd54+0], {%f322,%f332,%f342,%f41};
$Lt_0_51970:
	.loc	16	133	0
	exit;
$LDWend_AccumulateKernel:
	} // AccumulateKernel

