	.version 1.4
	.target sm_11, map_f64_to_f32
	// compiled with ../../../External/3rdParty/NVIDIA/CUDA/win/64/bin64/../open64/lib//be.exe
	// nvopencc 2.3 built on 2009-07-14

	//-----------------------------------------------------------
	// Compiling C:\Users\dvaeng\AppData\Local\Temp/tmpxft_0001db64_00000000-9_GaussianBlur.cpp3.i (C:/Users/dvaeng/AppData/Local/Temp/ccBI#.a20932)
	//-----------------------------------------------------------

	//-----------------------------------------------------------
	// Options:
	//-----------------------------------------------------------
	//  Target:ptx, ISA:sm_11, Endian:little, Pointer Size:64
	//  -O3	(Optimization level)
	//  -g0	(Debug level)
	//  -m2	(Report advisories)
	//-----------------------------------------------------------

	.file	1	"C:\Users\dvaeng\AppData\Local\Temp/tmpxft_0001db64_00000000-8_GaussianBlur.cudafe2.gpu"
	.file	2	"C:\Program Files (x86)\Microsoft Visual Studio 9.0\VC\include\crtdefs.h"
	.file	3	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\crt/device_runtime.h"
	.file	4	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\host_defines.h"
	.file	5	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\builtin_types.h"
	.file	6	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\device_types.h"
	.file	7	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\driver_types.h"
	.file	8	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\texture_types.h"
	.file	9	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\vector_types.h"
	.file	10	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\host_defines.h"
	.file	11	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\device_launch_parameters.h"
	.file	12	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\crt\storage_class.h"
	.file	13	"C:\Program Files (x86)\Microsoft Visual Studio 9.0\VC\include\time.h"
	.file	14	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/Utils.h"
	.file	15	"c:\scully64\shared\adobe\MediaCore\GPUFoundation\API\Inc\GPUFoundation/KernelSupport/PixelRGB.h"
	.file	16	"c:/scully64/shared/adobe/MediaCore/GPUFoundation/Src/ImageProcessing/GaussianBlur.cu"
	.file	17	"c:\scully64\shared\adobe\MediaCore\External\3rdParty\NVIDIA\CUDA\win\64\include\common_functions.h"
	.file	18	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\crt/func_macro.h"
	.file	19	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_functions.h"
	.file	20	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\device_functions.h"
	.file	21	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_constants.h"
	.file	22	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_11_atomic_functions.h"
	.file	23	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_12_atomic_functions.h"
	.file	24	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\sm_13_double_functions.h"
	.file	25	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\common_types.h"
	.file	26	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\texture_fetch_functions.h"
	.file	27	"c:\scully64\shared\adobe\mediacore\external\3rdparty\nvidia\cuda\win\64\include\math_functions_dbl_ptx1.h"


	.entry VerticalRecursiveGaussianRGBAF32_kernel (
		.param .u64 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_pIn,
		.param .s32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_src_pitch_f4,
		.param .s32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_src_width,
		.param .s32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_src_height,
		.param .u64 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_pOut,
		.param .s32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4,
		.param .s32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_dest_width,
		.param .s32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_dest_height,
		.param .s8 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_repeat_edge_pixels,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_plus0,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_plus1,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_plus1,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_plus2,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_minus1,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_minus2,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_minus1,
		.param .f32 __cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_minus2)
	{
	.reg .u32 %r<86>;
	.reg .u64 %rd<29>;
	.reg .f32 %f<171>;
	.reg .pred %p<44>;
	.shared .align 4 .b8 __cuda_smem80[1024];
	.loc	16	87	0
$LBB1_VerticalRecursiveGaussianRGBAF32_kernel:
	.loc	16	95	0
	cvt.s32.u16 	%r1, %tid.y;
	mov.s32 	%r2, %r1;
	.loc	16	99	0
	ld.param.s32 	%r3, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_src_height];
	ld.param.s32 	%r4, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_dest_height];
	sub.s32 	%r5, %r4, %r3;
	shr.s32 	%r6, %r5, 1;
	sub.s32 	%r7, %r1, %r6;
	mov.s32 	%r8, %r7;
	cvt.s32.u16 	%r9, %ntid.x;
	cvt.s32.u16 	%r10, %ctaid.x;
	mul24.lo.s32 	%r11, %r9, %r10;
	cvt.u32.u16 	%r12, %tid.x;
	add.u32 	%r13, %r11, %r12;
	ld.param.s32 	%r14, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_dest_width];
	setp.gt.s32 	%p1, %r14, %r13;
	@%p1 bra 	$Lt_0_26626;
	bra.uni 	$LBB77_VerticalRecursiveGaussianRGBAF32_kernel;
$Lt_0_26626:
	.loc	16	118	0
	ld.param.s32 	%r15, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_src_width];
	sub.s32 	%r16, %r14, %r15;
	shr.s32 	%r17, %r16, 1;
	sub.s32 	%r18, %r13, %r17;
	ld.param.s32 	%r19, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_src_pitch_f4];
	mul.lo.s32 	%r20, %r7, %r19;
	add.s32 	%r21, %r18, %r20;
	.loc	16	119	0
	ld.param.s32 	%r22, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4];
	mul.lo.s32 	%r23, %r22, %r1;
	add.s32 	%r24, %r13, %r23;
	mov.u32 	%r25, 0;
	setp.le.s32 	%p2, %r4, %r25;
	mov.u64 	%rd1, __cuda_smem80;
	mov.s32 	%r26, 0;
	@%p2 bra 	$Lt_0_38914;
	add.s32 	%r27, %r4, 3;
	shr.s32 	%r28, %r27, 31;
	mov.s32 	%r29, 3;
	and.b32 	%r30, %r28, %r29;
	add.s32 	%r31, %r30, %r27;
	shr.s32 	%r32, %r31, 2;
	shl.b32 	%r33, %r19, 2;
	mov.s32 	%r34, 16;
	mul24.lo.s32 	%r35, %r1, %r34;
	ld.param.s8 	%r36, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_repeat_edge_pixels];
	mov.s32 	%r37, 0;
	setp.ne.s32 	%p3, %r36, %r37;
	mov.pred 	%p4, %p3;
	mov.pred 	%p5, %p6;
	mov.s32 	%r38, 64;
	mul24.lo.s32 	%r39, %r1, %r38;
	shl.b32 	%r40, %r22, 2;
	add.u32 	%r41, %r35, %r12;
	selp.s32 	%r42, 1, 0, %p4;
	add.u32 	%r43, %r39, %r12;
	cvt.u64.s32 	%rd2, %r41;
	cvt.u64.s32 	%rd3, %r43;
	mul.lo.u64 	%rd4, %rd2, 4;
	mul.lo.u64 	%rd5, %rd3, 4;
	add.u64 	%rd6, %rd4, %rd1;
	add.u64 	%rd7, %rd5, %rd1;
	ld.param.f32 	%f1, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_plus2];
	ld.param.f32 	%f2, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_plus1];
	ld.param.f32 	%f3, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_plus0];
	ld.param.f32 	%f4, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_plus1];
	mov.f32 	%f5, 0f00000000;     	// 0
	mov.f32 	%f6, 0f00000000;     	// 0
	mov.f32 	%f7, 0f00000000;     	// 0
	mov.s32 	%r44, %r32;
$Lt_0_27650:
 //<loop> Loop body line 119, nesting depth: 1, estimated iterations: unknown
	.loc	16	123	0
	mov.u32 	%r45, 0;
	setp.lt.s32 	%p7, %r8, %r45;
	@%p7 bra 	$Lt_0_39682;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	setp.ge.s32 	%p8, %r8, %r3;
	@%p8 bra 	$Lt_0_39682;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	mov.u32 	%r46, 0;
	setp.lt.s32 	%p9, %r18, %r46;
	@%p9 bra 	$Lt_0_39682;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	setp.ge.s32 	%p10, %r18, %r15;
	@%p10 bra 	$Lt_0_39682;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	125	0
	ld.param.u64 	%rd8, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_pIn];
	cvt.u64.s32 	%rd9, %r21;
	mul.lo.u64 	%rd10, %rd9, 16;
	add.u64 	%rd11, %rd8, %rd10;
	ld.global.v4.f32 	{%f8,%f9,%f10,%f11}, [%rd11+0];
	.loc	16	31	0
	mov.f32 	%f12, 0f00000000;    	// 0
	setp.lt.f32 	%p11, %f8, %f12;
	@!%p11 bra 	$Lt_0_27906;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	15	196	0
	neg.f32 	%f13, %f8;
	lg2.approx.f32 	%f14, %f13;
	mov.f32 	%f15, 0f400ccccd;    	// 2.2
	mul.f32 	%f16, %f14, %f15;
	ex2.approx.f32 	%f17, %f16;
	neg.f32 	%f18, %f17;
	bra.uni 	$Lt_0_4354;
$Lt_0_27906:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	15	198	0
	lg2.approx.f32 	%f19, %f8;
	mov.f32 	%f20, 0f400ccccd;    	// 2.2
	mul.f32 	%f21, %f19, %f20;
	ex2.approx.f32 	%f18, %f21;
$Lt_0_4354:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	32	0
	mov.f32 	%f22, 0f00000000;    	// 0
	setp.lt.f32 	%p12, %f9, %f22;
	@!%p12 bra 	$Lt_0_28418;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	15	196	0
	neg.f32 	%f23, %f9;
	lg2.approx.f32 	%f24, %f23;
	mov.f32 	%f25, 0f400ccccd;    	// 2.2
	mul.f32 	%f26, %f24, %f25;
	ex2.approx.f32 	%f27, %f26;
	neg.f32 	%f28, %f27;
	bra.uni 	$Lt_0_3842;
$Lt_0_28418:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	15	198	0
	lg2.approx.f32 	%f29, %f9;
	mov.f32 	%f30, 0f400ccccd;    	// 2.2
	mul.f32 	%f31, %f29, %f30;
	ex2.approx.f32 	%f28, %f31;
$Lt_0_3842:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	33	0
	mov.f32 	%f32, 0f00000000;    	// 0
	setp.lt.f32 	%p13, %f10, %f32;
	@!%p13 bra 	$Lt_0_28930;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	15	196	0
	neg.f32 	%f33, %f10;
	lg2.approx.f32 	%f34, %f33;
	mov.f32 	%f35, 0f400ccccd;    	// 2.2
	mul.f32 	%f36, %f34, %f35;
	ex2.approx.f32 	%f37, %f36;
	neg.f32 	%f38, %f37;
	bra.uni 	$Lt_0_3330;
$Lt_0_28930:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	15	198	0
	lg2.approx.f32 	%f39, %f10;
	mov.f32 	%f40, 0f400ccccd;    	// 2.2
	mul.f32 	%f41, %f39, %f40;
	ex2.approx.f32 	%f38, %f41;
$Lt_0_3330:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	34	0
	cvt.sat.f32.f32 	%f11, %f11;
	.loc	16	125	0
	mul.f32 	%f42, %f18, %f11;
	mul.f32 	%f43, %f28, %f11;
	mul.f32 	%f44, %f38, %f11;
	mov.f32 	%f45, %f11;
	bra.uni 	$L_0_24066;
$Lt_0_39682:
$L_0_24322:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	127	0
	mov.f32 	%f45, 0f00000000;    	// 0
	mov.f32 	%f44, 0f00000000;    	// 0
	mov.f32 	%f43, 0f00000000;    	// 0
	mov.f32 	%f42, 0f00000000;    	// 0
$L_0_24066:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	129	0
	st.shared.f32 	[%rd6+0], %f42;
	.loc	16	130	0
	st.shared.f32 	[%rd6+256], %f43;
	.loc	16	131	0
	st.shared.f32 	[%rd6+512], %f44;
	.loc	16	132	0
	st.shared.f32 	[%rd6+768], %f45;
	.loc	16	134	0
	bar.sync 	0;
	.loc	16	142	0
	ld.shared.f32 	%f46, [%rd7+0];
	mov.s32 	%r47, 0;
	setp.eq.s32 	%p14, %r26, %r47;
	selp.s32 	%r48, 1, 0, %p14;
	and.b32 	%r49, %r48, %r42;
	mov.u32 	%r50, 0;
	setp.eq.s32 	%p15, %r49, %r50;
	@%p15 bra 	$Lt_0_29442;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	145	0
	mov.f32 	%f47, 0f3f000000;    	// 0.5
	mul.f32 	%f48, %f46, %f47;
	mov.f32 	%f5, %f48;
	mov.f32 	%f6, %f48;
$Lt_0_29442:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	148	0
	mul.f32 	%f49, %f4, %f7;
	mad.f32 	%f50, %f3, %f46, %f49;
	mad.f32 	%f51, %f2, %f6, %f50;
	mad.f32 	%f52, %f1, %f5, %f51;
	.loc	16	151	0
	mov.f32 	%f5, %f6;
	.loc	16	152	0
	mov.f32 	%f6, %f52;
	.loc	16	154	0
	st.shared.f32 	[%rd7+0], %f52;
	.loc	16	142	0
	ld.shared.f32 	%f53, [%rd7+64];
	mov.u32 	%r51, 0;
	setp.eq.s32 	%p16, %r49, %r51;
	@%p16 bra 	$Lt_0_29954;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	145	0
	mov.f32 	%f54, 0f3f000000;    	// 0.5
	mul.f32 	%f48, %f53, %f54;
	mov.f32 	%f5, %f48;
	mov.f32 	%f6, %f48;
$Lt_0_29954:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	148	0
	mul.f32 	%f55, %f46, %f4;
	mad.f32 	%f56, %f3, %f53, %f55;
	mad.f32 	%f57, %f2, %f6, %f56;
	mad.f32 	%f52, %f1, %f5, %f57;
	.loc	16	151	0
	mov.f32 	%f5, %f6;
	.loc	16	152	0
	mov.f32 	%f6, %f52;
	.loc	16	154	0
	st.shared.f32 	[%rd7+64], %f52;
	.loc	16	142	0
	ld.shared.f32 	%f58, [%rd7+128];
	mov.u32 	%r52, 0;
	setp.eq.s32 	%p17, %r49, %r52;
	@%p17 bra 	$Lt_0_30466;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	145	0
	mov.f32 	%f59, 0f3f000000;    	// 0.5
	mul.f32 	%f48, %f58, %f59;
	mov.f32 	%f5, %f48;
	mov.f32 	%f6, %f48;
$Lt_0_30466:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	148	0
	mul.f32 	%f60, %f53, %f4;
	mad.f32 	%f61, %f3, %f58, %f60;
	mad.f32 	%f62, %f2, %f6, %f61;
	mad.f32 	%f52, %f1, %f5, %f62;
	.loc	16	151	0
	mov.f32 	%f5, %f6;
	.loc	16	152	0
	mov.f32 	%f6, %f52;
	.loc	16	154	0
	st.shared.f32 	[%rd7+128], %f52;
	.loc	16	142	0
	ld.shared.f32 	%f63, [%rd7+192];
	mov.u32 	%r53, 0;
	setp.eq.s32 	%p18, %r49, %r53;
	@%p18 bra 	$Lt_0_30978;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	145	0
	mov.f32 	%f64, 0f3f000000;    	// 0.5
	mul.f32 	%f48, %f63, %f64;
	mov.f32 	%f5, %f48;
	mov.f32 	%f6, %f48;
$Lt_0_30978:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	148	0
	mul.f32 	%f65, %f58, %f4;
	mad.f32 	%f66, %f3, %f63, %f65;
	mad.f32 	%f67, %f2, %f6, %f66;
	mad.f32 	%f52, %f1, %f5, %f67;
	.loc	16	150	0
	mov.f32 	%f7, %f63;
	.loc	16	151	0
	mov.f32 	%f5, %f6;
	.loc	16	152	0
	mov.f32 	%f6, %f52;
	.loc	16	154	0
	st.shared.f32 	[%rd7+192], %f52;
	.loc	16	157	0
	bar.sync 	0;
	.loc	16	160	0
	setp.ge.s32 	%p19, %r2, %r4;
	@%p19 bra 	$Lt_0_31490;
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	163	0
	ld.shared.f32 	%f42, [%rd6+0];
	.loc	16	164	0
	ld.shared.f32 	%f43, [%rd6+256];
	.loc	16	165	0
	ld.shared.f32 	%f44, [%rd6+512];
	.loc	16	166	0
	ld.shared.f32 	%f45, [%rd6+768];
	.loc	16	167	0
	ld.param.u64 	%rd12, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_pOut];
	cvt.u64.s32 	%rd13, %r24;
	mul.lo.u64 	%rd14, %rd13, 16;
	add.u64 	%rd15, %rd12, %rd14;
	st.global.v4.f32 	[%rd15+0], {%f42,%f43,%f44,%f45};
$Lt_0_31490:
 //<loop> Part of loop body line 119, head labeled $Lt_0_27650
	.loc	16	169	0
	bar.sync 	0;
	.loc	16	171	0
	add.s32 	%r26, %r26, 4;
	.loc	16	172	0
	add.s32 	%r8, %r8, 4;
	.loc	16	173	0
	add.s32 	%r2, %r2, 4;
	.loc	16	174	0
	add.s32 	%r21, %r33, %r21;
	.loc	16	175	0
	add.s32 	%r24, %r40, %r24;
	setp.gt.s32 	%p20, %r4, %r26;
	@%p20 bra 	$Lt_0_27650;
	mov.f32 	%f68, %f63;
	bra.uni 	$Lt_0_27138;
$Lt_0_38914:
$Lt_0_27138:
	mov.u32 	%r54, 0;
	setp.le.s32 	%p21, %r26, %r54;
	@%p21 bra 	$LBB77_VerticalRecursiveGaussianRGBAF32_kernel;
	add.s32 	%r55, %r26, 3;
	shr.s32 	%r56, %r55, 31;
	mov.s32 	%r57, 3;
	and.b32 	%r58, %r56, %r57;
	add.s32 	%r59, %r58, %r55;
	shr.s32 	%r60, %r59, 2;
	shl.b32 	%r33, %r19, 2;
	mov.s32 	%r61, 16;
	mul24.lo.s32 	%r62, %r1, %r61;
	sub.s32 	%r63, %r4, 4;
	ld.param.s8 	%r64, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_repeat_edge_pixels];
	mov.s32 	%r65, 0;
	setp.ne.s32 	%p22, %r64, %r65;
	mov.pred 	%p23, %p22;
	mov.pred 	%p24, %p6;
	mov.s32 	%r66, 64;
	mul24.lo.s32 	%r67, %r1, %r66;
	mul.lo.s32 	%r68, %r8, %r19;
	mul.lo.s32 	%r69, %r19, -4;
	add.u32 	%r70, %r62, %r12;
	selp.s32 	%r42, 1, 0, %p23;
	add.u32 	%r71, %r67, %r12;
	cvt.u64.s32 	%rd16, %r70;
	cvt.u64.s32 	%rd17, %r71;
	add.s32 	%r72, %r68, %r18;
	mul.lo.u64 	%rd18, %rd16, 4;
	mul.lo.u64 	%rd19, %rd17, 4;
	add.u64 	%rd6, %rd18, %rd1;
	add.u64 	%rd7, %rd19, %rd1;
	ld.param.f32 	%f69, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_minus2];
	ld.param.f32 	%f70, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_neg_d_minus1];
	ld.param.f32 	%f71, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_minus1];
	ld.param.f32 	%f72, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_n_minus2];
	mov.f32 	%f73, 0f00000000;    	// 0
	mov.f32 	%f5, 0f00000000;     	// 0
	mov.f32 	%f6, 0f00000000;     	// 0
	mov.f32 	%f7, 0f00000000;     	// 0
	mov.s32 	%r73, %r60;
$Lt_0_32770:
 //<loop> Loop body line 175, nesting depth: 1, estimated iterations: unknown
	.loc	16	191	0
	sub.s32 	%r26, %r26, 4;
	.loc	16	192	0
	sub.s32 	%r8, %r8, 4;
	add.s32 	%r72, %r69, %r72;
	.loc	16	193	0
	sub.s32 	%r2, %r2, 4;
	.loc	16	194	0
	sub.s32 	%r21, %r21, %r33;
	.loc	16	191	0
	mov.u32 	%r74, 0;
	setp.lt.s32 	%p25, %r8, %r74;
	@%p25 bra 	$Lt_0_40962;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	setp.ge.s32 	%p26, %r8, %r3;
	@%p26 bra 	$Lt_0_40962;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	mov.u32 	%r75, 0;
	setp.lt.s32 	%p27, %r18, %r75;
	@%p27 bra 	$Lt_0_40962;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	setp.ge.s32 	%p28, %r18, %r15;
	@%p28 bra 	$Lt_0_40962;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	201	0
	ld.param.u64 	%rd20, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_pIn];
	cvt.u64.s32 	%rd21, %r21;
	mul.lo.u64 	%rd22, %rd21, 16;
	add.u64 	%rd23, %rd20, %rd22;
	ld.global.v4.f32 	{%f74,%f75,%f76,%f77}, [%rd23+0];
	.loc	16	31	0
	mov.f32 	%f78, 0f00000000;    	// 0
	setp.lt.f32 	%p29, %f74, %f78;
	@!%p29 bra 	$Lt_0_33026;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	196	0
	neg.f32 	%f79, %f74;
	lg2.approx.f32 	%f80, %f79;
	mov.f32 	%f81, 0f400ccccd;    	// 2.2
	mul.f32 	%f82, %f80, %f81;
	ex2.approx.f32 	%f83, %f82;
	neg.f32 	%f18, %f83;
	bra.uni 	$Lt_0_2818;
$Lt_0_33026:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	198	0
	lg2.approx.f32 	%f84, %f74;
	mov.f32 	%f85, 0f400ccccd;    	// 2.2
	mul.f32 	%f86, %f84, %f85;
	ex2.approx.f32 	%f18, %f86;
$Lt_0_2818:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	32	0
	mov.f32 	%f87, 0f00000000;    	// 0
	setp.lt.f32 	%p30, %f75, %f87;
	@!%p30 bra 	$Lt_0_33538;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	196	0
	neg.f32 	%f88, %f75;
	lg2.approx.f32 	%f89, %f88;
	mov.f32 	%f90, 0f400ccccd;    	// 2.2
	mul.f32 	%f91, %f89, %f90;
	ex2.approx.f32 	%f92, %f91;
	neg.f32 	%f28, %f92;
	bra.uni 	$Lt_0_2306;
$Lt_0_33538:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	198	0
	lg2.approx.f32 	%f93, %f75;
	mov.f32 	%f94, 0f400ccccd;    	// 2.2
	mul.f32 	%f95, %f93, %f94;
	ex2.approx.f32 	%f28, %f95;
$Lt_0_2306:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	33	0
	mov.f32 	%f96, 0f00000000;    	// 0
	setp.lt.f32 	%p31, %f76, %f96;
	@!%p31 bra 	$Lt_0_34050;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	196	0
	neg.f32 	%f97, %f76;
	lg2.approx.f32 	%f98, %f97;
	mov.f32 	%f99, 0f400ccccd;    	// 2.2
	mul.f32 	%f100, %f98, %f99;
	ex2.approx.f32 	%f101, %f100;
	neg.f32 	%f38, %f101;
	bra.uni 	$Lt_0_1794;
$Lt_0_34050:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	198	0
	lg2.approx.f32 	%f102, %f76;
	mov.f32 	%f103, 0f400ccccd;   	// 2.2
	mul.f32 	%f104, %f102, %f103;
	ex2.approx.f32 	%f38, %f104;
$Lt_0_1794:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	34	0
	cvt.sat.f32.f32 	%f77, %f77;
	.loc	16	201	0
	mul.f32 	%f42, %f18, %f77;
	mul.f32 	%f43, %f28, %f77;
	mul.f32 	%f44, %f38, %f77;
	mov.f32 	%f45, %f77;
	bra.uni 	$L_0_25346;
$Lt_0_40962:
$L_0_25602:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	203	0
	mov.f32 	%f45, 0f00000000;    	// 0
	mov.f32 	%f44, 0f00000000;    	// 0
	mov.f32 	%f43, 0f00000000;    	// 0
	mov.f32 	%f42, 0f00000000;    	// 0
$L_0_25346:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	205	0
	st.shared.f32 	[%rd6+0], %f42;
	.loc	16	206	0
	st.shared.f32 	[%rd6+256], %f43;
	.loc	16	207	0
	st.shared.f32 	[%rd6+512], %f44;
	.loc	16	208	0
	st.shared.f32 	[%rd6+768], %f45;
	.loc	16	210	0
	bar.sync 	0;
	.loc	16	213	0
	setp.eq.s32 	%p32, %r63, %r26;
	selp.s32 	%r76, 1, 0, %p32;
	and.b32 	%r77, %r76, %r42;
	mov.u32 	%r78, 0;
	setp.eq.s32 	%p33, %r77, %r78;
	@%p33 bra 	$Lt_0_34562;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	218	0
	mov.f32 	%f105, %f68;
	mov.f32 	%f106, 0f3f000000;   	// 0.5
	mul.f32 	%f107, %f105, %f106;
	mov.f32 	%f5, %f107;
	mov.f32 	%f6, %f107;
$Lt_0_34562:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	220	0
	mov.f32 	%f108, %f7;
	mul.f32 	%f109, %f72, %f73;
	mad.f32 	%f110, %f71, %f108, %f109;
	mad.f32 	%f111, %f70, %f6, %f110;
	mad.f32 	%f52, %f69, %f5, %f111;
	.loc	16	223	0
	ld.shared.f32 	%f112, [%rd7+192];
	.loc	16	224	0
	mov.f32 	%f5, %f6;
	.loc	16	225	0
	mov.f32 	%f6, %f52;
	.loc	16	227	0
	st.shared.f32 	[%rd7+192], %f52;
	mov.u32 	%r79, 0;
	setp.eq.s32 	%p34, %r77, %r79;
	@%p34 bra 	$Lt_0_35074;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	218	0
	mov.f32 	%f113, %f68;
	mov.f32 	%f114, 0f3f000000;   	// 0.5
	mul.f32 	%f107, %f113, %f114;
	mov.f32 	%f5, %f107;
	mov.f32 	%f6, %f107;
$Lt_0_35074:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	220	0
	mul.f32 	%f115, %f108, %f72;
	mad.f32 	%f116, %f71, %f112, %f115;
	mad.f32 	%f117, %f70, %f6, %f116;
	mad.f32 	%f52, %f69, %f5, %f117;
	.loc	16	223	0
	ld.shared.f32 	%f118, [%rd7+128];
	.loc	16	224	0
	mov.f32 	%f5, %f6;
	.loc	16	225	0
	mov.f32 	%f6, %f52;
	.loc	16	227	0
	st.shared.f32 	[%rd7+128], %f52;
	mov.u32 	%r80, 0;
	setp.eq.s32 	%p35, %r77, %r80;
	@%p35 bra 	$Lt_0_35586;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	218	0
	mov.f32 	%f119, %f68;
	mov.f32 	%f120, 0f3f000000;   	// 0.5
	mul.f32 	%f107, %f119, %f120;
	mov.f32 	%f5, %f107;
	mov.f32 	%f6, %f107;
$Lt_0_35586:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	220	0
	mul.f32 	%f121, %f112, %f72;
	mad.f32 	%f122, %f71, %f118, %f121;
	mad.f32 	%f123, %f70, %f6, %f122;
	mad.f32 	%f52, %f69, %f5, %f123;
	.loc	16	223	0
	ld.shared.f32 	%f7, [%rd7+64];
	.loc	16	224	0
	mov.f32 	%f5, %f6;
	.loc	16	225	0
	mov.f32 	%f6, %f52;
	.loc	16	227	0
	st.shared.f32 	[%rd7+64], %f52;
	mov.u32 	%r81, 0;
	setp.eq.s32 	%p36, %r77, %r81;
	@%p36 bra 	$Lt_0_36098;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	218	0
	mov.f32 	%f124, %f68;
	mov.f32 	%f125, 0f3f000000;   	// 0.5
	mul.f32 	%f107, %f124, %f125;
	mov.f32 	%f5, %f107;
	mov.f32 	%f6, %f107;
$Lt_0_36098:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	220	0
	mul.f32 	%f126, %f118, %f72;
	mad.f32 	%f127, %f71, %f7, %f126;
	mad.f32 	%f128, %f70, %f6, %f127;
	mad.f32 	%f52, %f69, %f5, %f128;
	.loc	16	222	0
	mov.f32 	%f73, %f7;
	.loc	16	223	0
	ld.shared.f32 	%f7, [%rd7+0];
	.loc	16	224	0
	mov.f32 	%f5, %f6;
	.loc	16	225	0
	mov.f32 	%f6, %f52;
	.loc	16	227	0
	st.shared.f32 	[%rd7+0], %f52;
	.loc	16	230	0
	bar.sync 	0;
	.loc	16	234	0
	mov.s32 	%r21, %r72;
	.loc	16	236	0
	setp.ge.s32 	%p37, %r2, %r4;
	@%p37 bra 	$Lt_0_36610;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	239	0
	ld.param.u64 	%rd24, [__cudaparm_VerticalRecursiveGaussianRGBAF32_kernel_pOut];
	mul.lo.s32 	%r82, %r2, %r22;
	add.s32 	%r83, %r13, %r82;
	cvt.u64.s32 	%rd25, %r83;
	mul.lo.u64 	%rd26, %rd25, 16;
	add.u64 	%rd27, %rd24, %rd26;
	ld.global.v4.f32 	{%f42,%f43,%f44,%f45}, [%rd27+0];
	.loc	16	241	0
	ld.shared.f32 	%f129, [%rd6+0];
	add.f32 	%f42, %f129, %f42;
	.loc	16	242	0
	ld.shared.f32 	%f130, [%rd6+256];
	add.f32 	%f43, %f130, %f43;
	.loc	16	243	0
	ld.shared.f32 	%f131, [%rd6+512];
	add.f32 	%f44, %f131, %f44;
	.loc	16	244	0
	ld.shared.f32 	%f132, [%rd6+768];
	add.f32 	%f45, %f132, %f45;
	.loc	16	48	0
	mov.f32 	%f133, 0f00000000;   	// 0
	setp.neu.f32 	%p38, %f45, %f133;
	rcp.approx.f32 	%f134, %f45;
	mov.f32 	%f135, 0f00000000;   	// 0
	selp.f32 	%f136, %f134, %f135, %p38;
	mul.f32 	%f137, %f136, %f42;
	mov.f32 	%f138, 0f00000000;   	// 0
	setp.lt.f32 	%p39, %f137, %f138;
	@!%p39 bra 	$Lt_0_37122;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	204	0
	neg.f32 	%f139, %f137;
	lg2.approx.f32 	%f140, %f139;
	mov.f32 	%f141, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f142, %f140, %f141;
	ex2.approx.f32 	%f143, %f142;
	neg.f32 	%f144, %f143;
	bra.uni 	$Lt_0_1282;
$Lt_0_37122:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	206	0
	lg2.approx.f32 	%f145, %f137;
	mov.f32 	%f146, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f147, %f145, %f146;
	ex2.approx.f32 	%f144, %f147;
$Lt_0_1282:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	49	0
	mul.f32 	%f148, %f136, %f43;
	mov.f32 	%f149, 0f00000000;   	// 0
	setp.lt.f32 	%p40, %f148, %f149;
	@!%p40 bra 	$Lt_0_37634;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	204	0
	neg.f32 	%f150, %f148;
	lg2.approx.f32 	%f151, %f150;
	mov.f32 	%f152, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f153, %f151, %f152;
	ex2.approx.f32 	%f154, %f153;
	neg.f32 	%f155, %f154;
	bra.uni 	$Lt_0_770;
$Lt_0_37634:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	206	0
	lg2.approx.f32 	%f156, %f148;
	mov.f32 	%f157, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f158, %f156, %f157;
	ex2.approx.f32 	%f155, %f158;
$Lt_0_770:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	50	0
	mul.f32 	%f159, %f136, %f44;
	mov.f32 	%f160, 0f00000000;   	// 0
	setp.lt.f32 	%p41, %f159, %f160;
	@!%p41 bra 	$Lt_0_38146;
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	204	0
	neg.f32 	%f161, %f159;
	lg2.approx.f32 	%f162, %f161;
	mov.f32 	%f163, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f164, %f162, %f163;
	ex2.approx.f32 	%f165, %f164;
	neg.f32 	%f166, %f165;
	bra.uni 	$Lt_0_258;
$Lt_0_38146:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	15	206	0
	lg2.approx.f32 	%f167, %f159;
	mov.f32 	%f168, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f169, %f167, %f168;
	ex2.approx.f32 	%f166, %f169;
$Lt_0_258:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	st.global.v4.f32 	[%rd27+0], {%f144,%f155,%f166,%f45};
$Lt_0_36610:
 //<loop> Part of loop body line 175, head labeled $Lt_0_32770
	.loc	16	249	0
	bar.sync 	0;
	mov.u32 	%r84, 0;
	setp.gt.s32 	%p42, %r26, %r84;
	@%p42 bra 	$Lt_0_32770;
$LBB77_VerticalRecursiveGaussianRGBAF32_kernel:
	.loc	16	253	0
	exit;
$LDWend_VerticalRecursiveGaussianRGBAF32_kernel:
	} // VerticalRecursiveGaussianRGBAF32_kernel

	.entry HorizontalRecursiveGaussianRGBAF32_kernel (
		.param .u64 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pIn,
		.param .s32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_pitch_f4,
		.param .s32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_width,
		.param .s32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_height,
		.param .u64 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pOut,
		.param .s32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4,
		.param .s32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_width,
		.param .s32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_height,
		.param .s8 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_repeat_edge_pixels,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_plus0,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_plus1,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_plus1,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_plus2,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_minus1,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_minus2,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_minus1,
		.param .f32 __cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_minus2)
	{
	.reg .u32 %r<130>;
	.reg .u64 %rd<55>;
	.reg .f32 %f<139>;
	.reg .pred %p<52>;
	.shared .align 4 .b8 __cuda_smem1184[2176];
	.loc	16	283	0
$LBB1_HorizontalRecursiveGaussianRGBAF32_kernel:
	.loc	16	305	0
	ld.param.s32 	%r1, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_width];
	mov.u32 	%r2, 0;
	setp.le.s32 	%p1, %r1, %r2;
	mov.s32 	%r3, 0;
	mov.u64 	%rd1, __cuda_smem1184;
	@%p1 bra 	$Lt_1_51970;
	cvt.s32.u16 	%r4, %ctaid.y;
	mov.s32 	%r5, 8;
	mul24.lo.s32 	%r6, %r4, %r5;
	ld.param.s32 	%r7, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_height];
	ld.param.s32 	%r8, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_height];
	sub.s32 	%r9, %r8, %r7;
	cvt.u32.u16 	%r10, %tid.y;
	add.u32 	%r11, %r6, %r10;
	shr.s32 	%r12, %r9, 1;
	sub.s32 	%r13, %r11, %r12;
	add.s32 	%r14, %r1, 15;
	shr.s32 	%r15, %r14, 31;
	mov.s32 	%r16, 15;
	and.b32 	%r17, %r15, %r16;
	add.s32 	%r18, %r17, %r14;
	shr.s32 	%r19, %r18, 4;
	cvt.u32.u16 	%r20, %tid.x;
	mov.s32 	%r21, %r20;
	add.u32 	%r22, %r1, %r20;
	ld.param.s32 	%r23, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_width];
	sub.s32 	%r24, %r1, %r23;
	mov.s32 	%r25, 17;
	mul24.lo.s32 	%r26, %r10, %r25;
	shl.b32 	%r27, %r10, 4;
	ld.param.s8 	%r28, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_repeat_edge_pixels];
	mov.s32 	%r29, 0;
	setp.ne.s32 	%p2, %r28, %r29;
	mov.pred 	%p3, %p2;
	mov.pred 	%p4, %p5;
	shr.s32 	%r30, %r24, 1;
	add.u32 	%r31, %r26, %r20;
	add.u32 	%r32, %r27, %r20;
	selp.s32 	%r33, 1, 0, %p3;
	setp.gt.s32 	%p6, %r8, %r11;
	add.s32 	%r34, %r11, 2;
	add.s32 	%r35, %r11, 4;
	add.s32 	%r36, %r11, 6;
	mov.s32 	%r37, 17;
	mul24.lo.s32 	%r38, %r32, %r37;
	setp.lt.s32 	%p7, %r34, %r8;
	setp.lt.s32 	%p8, %r35, %r8;
	setp.lt.s32 	%p9, %r36, %r8;
	ld.param.s32 	%r39, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_pitch_f4];
	mul.lo.s32 	%r40, %r13, %r39;
	ld.param.f32 	%f1, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_plus2];
	ld.param.f32 	%f2, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_plus1];
	ld.param.f32 	%f3, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_plus0];
	ld.param.f32 	%f4, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_plus1];
	mov.f32 	%f5, 0f00000000;     	// 0
	mov.f32 	%f6, 0f00000000;     	// 0
	mov.f32 	%f7, 0f00000000;     	// 0
	mov.s32 	%r41, %r19;
$Lt_1_33538:
 //<loop> Loop body line 305, nesting depth: 1, estimated iterations: unknown
	.loc	16	319	0
	sub.s32 	%r42, %r21, %r30;
	add.s32 	%r43, %r42, %r40;
	.loc	16	321	0
	mov.s32 	%r44, 0;
$Lt_1_34306:
 //<loop> Loop body line 321, nesting depth: 2, iterations: 4
	shl.b32 	%r45, %r44, 1;
	add.s32 	%r46, %r13, %r45;
	setp.le.s32 	%p10, %r7, %r46;
	@%p10 bra 	$Lt_1_34562;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	16	328	0
	mov.u32 	%r47, 0;
	setp.lt.s32 	%p11, %r13, %r47;
	@%p11 bra 	$Lt_1_52738;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	setp.ge.s32 	%p12, %r13, %r7;
	@%p12 bra 	$Lt_1_52738;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	mov.u32 	%r48, 0;
	setp.lt.s32 	%p13, %r42, %r48;
	@%p13 bra 	$Lt_1_52738;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	setp.ge.s32 	%p14, %r42, %r23;
	@%p14 bra 	$Lt_1_52738;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	16	329	0
	shl.b32 	%r49, %r39, 1;
	ld.param.u64 	%rd2, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pIn];
	mul.lo.s32 	%r50, %r49, %r44;
	add.s32 	%r51, %r43, %r50;
	cvt.u64.s32 	%rd3, %r51;
	mul.lo.u64 	%rd4, %rd3, 16;
	add.u64 	%rd5, %rd2, %rd4;
	ld.global.v4.f32 	{%f8,%f9,%f10,%f11}, [%rd5+0];
	.loc	16	31	0
	mov.f32 	%f12, 0f00000000;    	// 0
	setp.lt.f32 	%p15, %f8, %f12;
	@!%p15 bra 	$Lt_1_35074;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	15	196	0
	neg.f32 	%f13, %f8;
	lg2.approx.f32 	%f14, %f13;
	mov.f32 	%f15, 0f400ccccd;    	// 2.2
	mul.f32 	%f16, %f14, %f15;
	ex2.approx.f32 	%f17, %f16;
	neg.f32 	%f18, %f17;
	bra.uni 	$Lt_1_4354;
$Lt_1_35074:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	15	198	0
	lg2.approx.f32 	%f19, %f8;
	mov.f32 	%f20, 0f400ccccd;    	// 2.2
	mul.f32 	%f21, %f19, %f20;
	ex2.approx.f32 	%f18, %f21;
$Lt_1_4354:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	16	32	0
	mov.f32 	%f22, 0f00000000;    	// 0
	setp.lt.f32 	%p16, %f9, %f22;
	@!%p16 bra 	$Lt_1_35586;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	15	196	0
	neg.f32 	%f23, %f9;
	lg2.approx.f32 	%f24, %f23;
	mov.f32 	%f25, 0f400ccccd;    	// 2.2
	mul.f32 	%f26, %f24, %f25;
	ex2.approx.f32 	%f27, %f26;
	neg.f32 	%f28, %f27;
	bra.uni 	$Lt_1_3842;
$Lt_1_35586:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	15	198	0
	lg2.approx.f32 	%f29, %f9;
	mov.f32 	%f30, 0f400ccccd;    	// 2.2
	mul.f32 	%f31, %f29, %f30;
	ex2.approx.f32 	%f28, %f31;
$Lt_1_3842:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	16	33	0
	mov.f32 	%f32, 0f00000000;    	// 0
	setp.lt.f32 	%p17, %f10, %f32;
	@!%p17 bra 	$Lt_1_36098;
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	15	196	0
	neg.f32 	%f33, %f10;
	lg2.approx.f32 	%f34, %f33;
	mov.f32 	%f35, 0f400ccccd;    	// 2.2
	mul.f32 	%f36, %f34, %f35;
	ex2.approx.f32 	%f37, %f36;
	neg.f32 	%f38, %f37;
	bra.uni 	$Lt_1_3330;
$Lt_1_36098:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	15	198	0
	lg2.approx.f32 	%f39, %f10;
	mov.f32 	%f40, 0f400ccccd;    	// 2.2
	mul.f32 	%f41, %f39, %f40;
	ex2.approx.f32 	%f38, %f41;
$Lt_1_3330:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	16	34	0
	cvt.sat.f32.f32 	%f11, %f11;
	.loc	16	329	0
	mul.f32 	%f42, %f18, %f11;
	mul.f32 	%f43, %f28, %f11;
	mul.f32 	%f44, %f38, %f11;
	mov.f32 	%f45, %f11;
	bra.uni 	$L_1_30466;
$Lt_1_52738:
$L_1_30722:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	16	331	0
	mov.f32 	%f45, 0f00000000;    	// 0
	mov.f32 	%f44, 0f00000000;    	// 0
	mov.f32 	%f43, 0f00000000;    	// 0
	mov.f32 	%f42, 0f00000000;    	// 0
$L_1_30466:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	.loc	16	334	0
	mul.lo.s32 	%r52, %r44, 34;
	add.s32 	%r53, %r31, %r52;
	cvt.u64.s32 	%rd6, %r53;
	mul.lo.u64 	%rd7, %rd6, 4;
	add.u64 	%rd8, %rd1, %rd7;
	st.shared.f32 	[%rd8+0], %f42;
	.loc	16	335	0
	st.shared.f32 	[%rd8+544], %f43;
	.loc	16	336	0
	st.shared.f32 	[%rd8+1088], %f44;
	.loc	16	337	0
	st.shared.f32 	[%rd8+1632], %f45;
$Lt_1_34562:
 //<loop> Part of loop body line 321, head labeled $Lt_1_34306
	add.s32 	%r44, %r44, 1;
	mov.u32 	%r54, 4;
	setp.ne.s32 	%p18, %r44, %r54;
	@%p18 bra 	$Lt_1_34306;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	350	0
	mov.s32 	%r55, %r38;
	add.s32 	%r56, %r38, 16;
	mov.s32 	%r57, 0;
	setp.eq.s32 	%p19, %r3, %r57;
	selp.s32 	%r58, 1, 0, %p19;
	and.b32 	%r59, %r58, %r33;
	cvt.u64.s32 	%rd9, %r38;
	mul.lo.u64 	%rd10, %rd9, 4;
	add.u64 	%rd11, %rd1, %rd10;
$Lt_1_37378:
 //<loop> Loop body line 350, nesting depth: 2, iterations: 16
	.loc	16	353	0
	ld.shared.f32 	%f46, [%rd11+0];
	mov.u32 	%r60, 0;
	setp.eq.s32 	%p20, %r59, %r60;
	@%p20 bra 	$Lt_1_37634;
 //<loop> Part of loop body line 350, head labeled $Lt_1_37378
	.loc	16	356	0
	mov.f32 	%f47, 0f3f000000;    	// 0.5
	mul.f32 	%f48, %f46, %f47;
	mov.f32 	%f5, %f48;
	mov.f32 	%f6, %f48;
$Lt_1_37634:
 //<loop> Part of loop body line 350, head labeled $Lt_1_37378
	.loc	16	358	0
	mul.f32 	%f49, %f4, %f7;
	mad.f32 	%f50, %f3, %f46, %f49;
	mad.f32 	%f51, %f2, %f6, %f50;
	mad.f32 	%f52, %f1, %f5, %f51;
	.loc	16	360	0
	mov.f32 	%f7, %f46;
	.loc	16	361	0
	mov.f32 	%f5, %f6;
	.loc	16	362	0
	mov.f32 	%f6, %f52;
	.loc	16	364	0
	st.shared.f32 	[%rd11+0], %f52;
	add.s32 	%r55, %r55, 1;
	add.u64 	%rd11, %rd11, 4;
	setp.ne.s32 	%p21, %r55, %r56;
	@%p21 bra 	$Lt_1_37378;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	373	0
	@!%p6 bra 	$Lt_1_38914;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	380	0
	cvt.u64.s32 	%rd12, %r31;
	mul.lo.u64 	%rd13, %rd12, 4;
	add.u64 	%rd14, %rd1, %rd13;
	ld.shared.f32 	%f42, [%rd14+0];
	.loc	16	381	0
	ld.shared.f32 	%f43, [%rd14+544];
	.loc	16	382	0
	ld.shared.f32 	%f44, [%rd14+1088];
	.loc	16	383	0
	ld.shared.f32 	%f45, [%rd14+1632];
	setp.le.s32 	%p22, %r1, %r21;
	@%p22 bra 	$Lt_1_38914;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	387	0
	ld.param.u64 	%rd15, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pOut];
	ld.param.s32 	%r61, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4];
	mul.lo.s32 	%r62, %r61, %r11;
	add.s32 	%r63, %r21, %r62;
	cvt.u64.s32 	%rd16, %r63;
	mul.lo.u64 	%rd17, %rd16, 16;
	add.u64 	%rd18, %rd15, %rd17;
	st.global.v4.f32 	[%rd18+0], {%f42,%f43,%f44,%f45};
$Lt_1_38914:
$Lt_1_38402:
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	@!%p7 bra 	$Lt_1_39938;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	380	0
	cvt.u64.s32 	%rd19, %r31;
	mul.lo.u64 	%rd20, %rd19, 4;
	add.u64 	%rd14, %rd1, %rd20;
	ld.shared.f32 	%f42, [%rd14+136];
	.loc	16	381	0
	ld.shared.f32 	%f43, [%rd14+680];
	.loc	16	382	0
	ld.shared.f32 	%f44, [%rd14+1224];
	.loc	16	383	0
	ld.shared.f32 	%f45, [%rd14+1768];
	setp.le.s32 	%p23, %r1, %r21;
	@%p23 bra 	$Lt_1_39938;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	387	0
	ld.param.s32 	%r64, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4];
	shl.b32 	%r65, %r64, 1;
	mul.lo.s32 	%r66, %r64, %r11;
	ld.param.u64 	%rd21, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pOut];
	add.s32 	%r67, %r66, %r21;
	add.s32 	%r68, %r65, %r67;
	cvt.u64.s32 	%rd22, %r68;
	mul.lo.u64 	%rd23, %rd22, 16;
	add.u64 	%rd24, %rd21, %rd23;
	st.global.v4.f32 	[%rd24+0], {%f42,%f43,%f44,%f45};
$Lt_1_39938:
$Lt_1_39426:
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	@!%p8 bra 	$Lt_1_40962;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	380	0
	cvt.u64.s32 	%rd25, %r31;
	mul.lo.u64 	%rd26, %rd25, 4;
	add.u64 	%rd14, %rd1, %rd26;
	ld.shared.f32 	%f42, [%rd14+272];
	.loc	16	381	0
	ld.shared.f32 	%f43, [%rd14+816];
	.loc	16	382	0
	ld.shared.f32 	%f44, [%rd14+1360];
	.loc	16	383	0
	ld.shared.f32 	%f45, [%rd14+1904];
	setp.le.s32 	%p24, %r1, %r21;
	@%p24 bra 	$Lt_1_40962;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	387	0
	ld.param.s32 	%r64, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4];
	shl.b32 	%r65, %r64, 1;
	mul.lo.s32 	%r66, %r64, %r11;
	add.s32 	%r69, %r66, %r21;
	ld.param.u64 	%rd27, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pOut];
	add.s32 	%r70, %r65, %r69;
	add.s32 	%r71, %r65, %r70;
	cvt.u64.s32 	%rd28, %r71;
	mul.lo.u64 	%rd29, %rd28, 16;
	add.u64 	%rd30, %rd27, %rd29;
	st.global.v4.f32 	[%rd30+0], {%f42,%f43,%f44,%f45};
$Lt_1_40962:
$Lt_1_40450:
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	@!%p9 bra 	$Lt_1_41986;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	380	0
	cvt.u64.s32 	%rd31, %r31;
	mul.lo.u64 	%rd32, %rd31, 4;
	add.u64 	%rd14, %rd1, %rd32;
	ld.shared.f32 	%f42, [%rd14+408];
	.loc	16	381	0
	ld.shared.f32 	%f43, [%rd14+952];
	.loc	16	382	0
	ld.shared.f32 	%f44, [%rd14+1496];
	.loc	16	383	0
	ld.shared.f32 	%f45, [%rd14+2040];
	setp.le.s32 	%p25, %r1, %r21;
	@%p25 bra 	$Lt_1_41986;
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	.loc	16	387	0
	ld.param.s32 	%r64, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4];
	shl.b32 	%r65, %r64, 1;
	mul.lo.s32 	%r66, %r64, %r11;
	add.s32 	%r72, %r66, %r21;
	add.s32 	%r73, %r65, %r72;
	ld.param.u64 	%rd33, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pOut];
	add.s32 	%r74, %r73, %r65;
	add.s32 	%r75, %r65, %r74;
	cvt.u64.s32 	%rd34, %r75;
	mul.lo.u64 	%rd35, %rd34, 16;
	add.u64 	%rd36, %rd33, %rd35;
	st.global.v4.f32 	[%rd36+0], {%f42,%f43,%f44,%f45};
$Lt_1_41986:
$Lt_1_41474:
 //<loop> Part of loop body line 305, head labeled $Lt_1_33538
	add.s32 	%r3, %r3, 16;
	add.u32 	%r21, %r21, 16;
	setp.lt.s32 	%p26, %r21, %r22;
	@%p26 bra 	$Lt_1_33538;
	mov.f32 	%f53, %f46;
	bra.uni 	$Lt_1_33026;
$Lt_1_51970:
$Lt_1_33026:
	mov.u32 	%r76, 0;
	setp.le.s32 	%p27, %r3, %r76;
	@%p27 bra 	$Lt_1_42754;
	cvt.s32.u16 	%r77, %ctaid.y;
	mov.s32 	%r78, 8;
	mul24.lo.s32 	%r79, %r77, %r78;
	cvt.u32.u16 	%r80, %tid.y;
	add.u32 	%r11, %r79, %r80;
	ld.param.s32 	%r7, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_height];
	ld.param.s32 	%r8, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_height];
	sub.s32 	%r81, %r8, %r7;
	shr.s32 	%r82, %r81, 1;
	sub.s32 	%r13, %r11, %r82;
	add.s32 	%r83, %r3, 15;
	shr.s32 	%r84, %r83, 31;
	mov.s32 	%r85, 15;
	and.b32 	%r86, %r84, %r85;
	add.s32 	%r87, %r86, %r83;
	shr.s32 	%r88, %r87, 4;
	cvt.u32.u16 	%r20, %tid.x;
	add.u32 	%r21, %r3, %r20;
	ld.param.s32 	%r23, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_width];
	sub.s32 	%r89, %r1, %r23;
	mov.s32 	%r90, 17;
	mul24.lo.s32 	%r91, %r80, %r90;
	shl.b32 	%r92, %r80, 4;
	sub.s32 	%r93, %r1, 16;
	ld.param.s8 	%r94, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_repeat_edge_pixels];
	mov.s32 	%r95, 0;
	setp.ne.s32 	%p28, %r94, %r95;
	mov.pred 	%p29, %p28;
	mov.pred 	%p30, %p5;
	shr.s32 	%r30, %r89, 1;
	add.u32 	%r31, %r91, %r20;
	add.u32 	%r96, %r92, %r20;
	selp.s32 	%r33, 1, 0, %p29;
	ld.param.s32 	%r64, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_dest_pitch_f4];
	mul.lo.s32 	%r66, %r64, %r11;
	mov.s32 	%r97, 17;
	mul24.lo.s32 	%r98, %r96, %r97;
	add.s32 	%r99, %r66, %r20;
	ld.param.s32 	%r39, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_src_pitch_f4];
	mul.lo.s32 	%r40, %r13, %r39;
	add.s32 	%r100, %r98, 15;
	add.s32 	%r101, %r99, %r3;
	add.s32 	%r102, %r93, %r99;
	ld.param.f32 	%f54, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_minus2];
	ld.param.f32 	%f55, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_neg_d_minus1];
	ld.param.f32 	%f56, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_minus1];
	ld.param.f32 	%f57, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_n_minus2];
	mov.f32 	%f58, 0f00000000;    	// 0
	mov.f32 	%f5, 0f00000000;     	// 0
	mov.f32 	%f6, 0f00000000;     	// 0
	mov.f32 	%f7, 0f00000000;     	// 0
	mov.s32 	%r103, %r88;
$Lt_1_43266:
 //<loop> Loop body line 387, nesting depth: 1, estimated iterations: unknown
	.loc	16	409	0
	sub.s32 	%r104, %r101, 16;
	mov.s32 	%r101, %r104;
	sub.u32 	%r21, %r21, 16;
	.loc	16	415	0
	sub.s32 	%r42, %r21, %r30;
	add.s32 	%r43, %r42, %r40;
	.loc	16	417	0
	mov.s32 	%r105, 0;
$Lt_1_44034:
 //<loop> Loop body line 417, nesting depth: 1, iterations: 4
	shl.b32 	%r106, %r105, 1;
	add.s32 	%r107, %r13, %r106;
	setp.le.s32 	%p31, %r7, %r107;
	@%p31 bra 	$Lt_1_44290;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	16	424	0
	mov.u32 	%r108, 0;
	setp.lt.s32 	%p32, %r13, %r108;
	@%p32 bra 	$Lt_1_54018;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	setp.ge.s32 	%p33, %r13, %r7;
	@%p33 bra 	$Lt_1_54018;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	mov.u32 	%r109, 0;
	setp.lt.s32 	%p34, %r42, %r109;
	@%p34 bra 	$Lt_1_54018;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	setp.ge.s32 	%p35, %r42, %r23;
	@%p35 bra 	$Lt_1_54018;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	16	425	0
	shl.b32 	%r110, %r39, 1;
	ld.param.u64 	%rd37, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pIn];
	mul.lo.s32 	%r111, %r110, %r105;
	add.s32 	%r112, %r43, %r111;
	cvt.u64.s32 	%rd38, %r112;
	mul.lo.u64 	%rd39, %rd38, 16;
	add.u64 	%rd40, %rd37, %rd39;
	ld.global.v4.f32 	{%f59,%f60,%f61,%f62}, [%rd40+0];
	.loc	16	31	0
	mov.f32 	%f63, 0f00000000;    	// 0
	setp.lt.f32 	%p36, %f59, %f63;
	@!%p36 bra 	$Lt_1_44802;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	15	196	0
	neg.f32 	%f64, %f59;
	lg2.approx.f32 	%f65, %f64;
	mov.f32 	%f66, 0f400ccccd;    	// 2.2
	mul.f32 	%f67, %f65, %f66;
	ex2.approx.f32 	%f68, %f67;
	neg.f32 	%f18, %f68;
	bra.uni 	$Lt_1_2818;
$Lt_1_44802:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	15	198	0
	lg2.approx.f32 	%f69, %f59;
	mov.f32 	%f70, 0f400ccccd;    	// 2.2
	mul.f32 	%f71, %f69, %f70;
	ex2.approx.f32 	%f18, %f71;
$Lt_1_2818:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	16	32	0
	mov.f32 	%f72, 0f00000000;    	// 0
	setp.lt.f32 	%p37, %f60, %f72;
	@!%p37 bra 	$Lt_1_45314;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	15	196	0
	neg.f32 	%f73, %f60;
	lg2.approx.f32 	%f74, %f73;
	mov.f32 	%f75, 0f400ccccd;    	// 2.2
	mul.f32 	%f76, %f74, %f75;
	ex2.approx.f32 	%f77, %f76;
	neg.f32 	%f28, %f77;
	bra.uni 	$Lt_1_2306;
$Lt_1_45314:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	15	198	0
	lg2.approx.f32 	%f78, %f60;
	mov.f32 	%f79, 0f400ccccd;    	// 2.2
	mul.f32 	%f80, %f78, %f79;
	ex2.approx.f32 	%f28, %f80;
$Lt_1_2306:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	16	33	0
	mov.f32 	%f81, 0f00000000;    	// 0
	setp.lt.f32 	%p38, %f61, %f81;
	@!%p38 bra 	$Lt_1_45826;
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	15	196	0
	neg.f32 	%f82, %f61;
	lg2.approx.f32 	%f83, %f82;
	mov.f32 	%f84, 0f400ccccd;    	// 2.2
	mul.f32 	%f85, %f83, %f84;
	ex2.approx.f32 	%f86, %f85;
	neg.f32 	%f38, %f86;
	bra.uni 	$Lt_1_1794;
$Lt_1_45826:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	15	198	0
	lg2.approx.f32 	%f87, %f61;
	mov.f32 	%f88, 0f400ccccd;    	// 2.2
	mul.f32 	%f89, %f87, %f88;
	ex2.approx.f32 	%f38, %f89;
$Lt_1_1794:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	16	34	0
	cvt.sat.f32.f32 	%f62, %f62;
	.loc	16	425	0
	mul.f32 	%f42, %f18, %f62;
	mul.f32 	%f43, %f28, %f62;
	mul.f32 	%f44, %f38, %f62;
	mov.f32 	%f45, %f62;
	bra.uni 	$L_1_31746;
$Lt_1_54018:
$L_1_32002:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	16	427	0
	mov.f32 	%f45, 0f00000000;    	// 0
	mov.f32 	%f44, 0f00000000;    	// 0
	mov.f32 	%f43, 0f00000000;    	// 0
	mov.f32 	%f42, 0f00000000;    	// 0
$L_1_31746:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	.loc	16	430	0
	mul.lo.s32 	%r113, %r105, 34;
	add.s32 	%r114, %r31, %r113;
	cvt.u64.s32 	%rd41, %r114;
	mul.lo.u64 	%rd42, %rd41, 4;
	add.u64 	%rd43, %rd1, %rd42;
	st.shared.f32 	[%rd43+0], %f42;
	.loc	16	431	0
	st.shared.f32 	[%rd43+544], %f43;
	.loc	16	432	0
	st.shared.f32 	[%rd43+1088], %f44;
	.loc	16	433	0
	st.shared.f32 	[%rd43+1632], %f45;
$Lt_1_44290:
 //<loop> Part of loop body line 417, head labeled $Lt_1_44034
	add.s32 	%r105, %r105, 1;
	mov.u32 	%r115, 4;
	setp.ne.s32 	%p39, %r105, %r115;
	@%p39 bra 	$Lt_1_44034;
 //<loop> Part of loop body line 387, head labeled $Lt_1_43266
	.loc	16	445	0
	setp.eq.s32 	%p40, %r102, %r104;
	selp.s32 	%r116, 1, 0, %p40;
	cvt.u64.s32 	%rd44, %r100;
	mul.lo.u64 	%rd45, %rd44, 4;
	add.u64 	%rd46, %rd1, %rd45;
	and.b32 	%r117, %r116, %r33;
	mov.s32 	%r118, 15;
$Lt_1_47106:
 //<loop> Loop body line 445, nesting depth: 1, iterations: 16
	mov.u32 	%r119, 0;
	setp.eq.s32 	%p41, %r117, %r119;
	@%p41 bra 	$Lt_1_47362;
 //<loop> Part of loop body line 445, head labeled $Lt_1_47106
	.loc	16	450	0
	mov.f32 	%f90, %f53;
	mov.f32 	%f91, 0f3f000000;    	// 0.5
	mul.f32 	%f92, %f90, %f91;
	mov.f32 	%f5, %f92;
	mov.f32 	%f6, %f92;
$Lt_1_47362:
 //<loop> Part of loop body line 445, head labeled $Lt_1_47106
	.loc	16	452	0
	mul.f32 	%f93, %f57, %f58;
	mad.f32 	%f94, %f56, %f7, %f93;
	mad.f32 	%f95, %f55, %f6, %f94;
	mad.f32 	%f96, %f54, %f5, %f95;
	.loc	16	454	0
	mov.f32 	%f58, %f7;
	.loc	16	455	0
	ld.shared.f32 	%f7, [%rd46+0];
	.loc	16	456	0
	mov.f32 	%f5, %f6;
	.loc	16	457	0
	mov.f32 	%f6, %f96;
	.loc	16	459	0
	st.shared.f32 	[%rd46+0], %f96;
	.loc	16	460	0
	sub.u64 	%rd46, %rd46, 4;
	sub.s32 	%r118, %r118, 1;
	mov.u32 	%r120, -1;
	setp.ne.s32 	%p42, %r118, %r120;
	@%p42 bra 	$Lt_1_47106;
 //<loop> Part of loop body line 387, head labeled $Lt_1_43266
	.loc	16	467	0
	mov.s32 	%r121, 0;
$Lt_1_48642:
 //<loop> Loop body line 467, nesting depth: 1, iterations: 4
	shl.b32 	%r122, %r121, 1;
	add.s32 	%r123, %r11, %r122;
	setp.le.s32 	%p43, %r8, %r123;
	@%p43 bra 	$Lt_1_49410;
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	setp.le.s32 	%p44, %r1, %r21;
	@%p44 bra 	$Lt_1_49410;
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	16	477	0
	shl.b32 	%r65, %r64, 1;
	ld.param.u64 	%rd47, [__cudaparm_HorizontalRecursiveGaussianRGBAF32_kernel_pOut];
	mul.lo.s32 	%r124, %r65, %r121;
	add.s32 	%r125, %r104, %r124;
	cvt.u64.s32 	%rd48, %r125;
	mul.lo.u64 	%rd49, %rd48, 16;
	add.u64 	%rd50, %rd47, %rd49;
	ld.global.v4.f32 	{%f42,%f43,%f44,%f45}, [%rd50+0];
	.loc	16	480	0
	mul.lo.s32 	%r126, %r121, 34;
	add.s32 	%r127, %r31, %r126;
	cvt.u64.s32 	%rd51, %r127;
	mul.lo.u64 	%rd52, %rd51, 4;
	add.u64 	%rd53, %rd1, %rd52;
	ld.shared.f32 	%f97, [%rd53+0];
	add.f32 	%f42, %f97, %f42;
	.loc	16	481	0
	ld.shared.f32 	%f98, [%rd53+544];
	add.f32 	%f43, %f98, %f43;
	.loc	16	482	0
	ld.shared.f32 	%f99, [%rd53+1088];
	add.f32 	%f44, %f99, %f44;
	.loc	16	483	0
	ld.shared.f32 	%f100, [%rd53+1632];
	add.f32 	%f45, %f100, %f45;
	.loc	16	48	0
	mov.f32 	%f101, 0f00000000;   	// 0
	setp.neu.f32 	%p45, %f45, %f101;
	rcp.approx.f32 	%f102, %f45;
	mov.f32 	%f103, 0f00000000;   	// 0
	selp.f32 	%f104, %f102, %f103, %p45;
	mul.f32 	%f105, %f104, %f42;
	mov.f32 	%f106, 0f00000000;   	// 0
	setp.lt.f32 	%p46, %f105, %f106;
	@!%p46 bra 	$Lt_1_49922;
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	15	204	0
	neg.f32 	%f107, %f105;
	lg2.approx.f32 	%f108, %f107;
	mov.f32 	%f109, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f110, %f108, %f109;
	ex2.approx.f32 	%f111, %f110;
	neg.f32 	%f112, %f111;
	bra.uni 	$Lt_1_1282;
$Lt_1_49922:
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	15	206	0
	lg2.approx.f32 	%f113, %f105;
	mov.f32 	%f114, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f115, %f113, %f114;
	ex2.approx.f32 	%f112, %f115;
$Lt_1_1282:
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	16	49	0
	mul.f32 	%f116, %f104, %f43;
	mov.f32 	%f117, 0f00000000;   	// 0
	setp.lt.f32 	%p47, %f116, %f117;
	@!%p47 bra 	$Lt_1_50434;
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	15	204	0
	neg.f32 	%f118, %f116;
	lg2.approx.f32 	%f119, %f118;
	mov.f32 	%f120, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f121, %f119, %f120;
	ex2.approx.f32 	%f122, %f121;
	neg.f32 	%f123, %f122;
	bra.uni 	$Lt_1_770;
$Lt_1_50434:
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	15	206	0
	lg2.approx.f32 	%f124, %f116;
	mov.f32 	%f125, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f126, %f124, %f125;
	ex2.approx.f32 	%f123, %f126;
$Lt_1_770:
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	16	50	0
	mul.f32 	%f127, %f104, %f44;
	mov.f32 	%f128, 0f00000000;   	// 0
	setp.lt.f32 	%p48, %f127, %f128;
	@!%p48 bra 	$Lt_1_50946;
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	15	204	0
	neg.f32 	%f129, %f127;
	lg2.approx.f32 	%f130, %f129;
	mov.f32 	%f131, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f132, %f130, %f131;
	ex2.approx.f32 	%f133, %f132;
	neg.f32 	%f134, %f133;
	bra.uni 	$Lt_1_258;
$Lt_1_50946:
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	15	206	0
	lg2.approx.f32 	%f135, %f127;
	mov.f32 	%f136, 0f3ee8ba2e;   	// 0.454545
	mul.f32 	%f137, %f135, %f136;
	ex2.approx.f32 	%f134, %f137;
$Lt_1_258:
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	st.global.v4.f32 	[%rd50+0], {%f112,%f123,%f134,%f45};
$Lt_1_49410:
$Lt_1_48898:
 //<loop> Part of loop body line 467, head labeled $Lt_1_48642
	.loc	16	486	0
	add.s32 	%r121, %r121, 1;
	mov.u32 	%r128, 4;
	setp.ne.s32 	%p49, %r121, %r128;
	@%p49 bra 	$Lt_1_48642;
 //<loop> Part of loop body line 387, head labeled $Lt_1_43266
	setp.gt.s32 	%p50, %r21, %r20;
	@%p50 bra 	$Lt_1_43266;
$Lt_1_42754:
	.loc	16	497	0
	exit;
$LDWend_HorizontalRecursiveGaussianRGBAF32_kernel:
	} // HorizontalRecursiveGaussianRGBAF32_kernel

