- 支持公司流程运作的完整下机数据入库管理系统建设。
- 支持公司标准分析项目的流程搭建,如 RNA-seq, CHIP-seq, ATAC-seq, RIP-seq 等分析流程的定制化搭建。
- 借助流程完成标准分析项目,阅读文献完成个性化分析项目。
- GitHub中贡献代码被 Arctic Code Vault Contributor (北极代码库冰封千年冻存计划)收录。
-
编程方面:
- Linux方面,
- 对命令、循环、管道、环境变量管理、软件版本控制、Shell编程等都有较深的理解,熟悉awk/sed/grep等高级命令用法,熟悉Conda,Docker,SGE等应用,有配置阿里云华为云云计算的经验,了解SJM/nextflow/nf-core等流程研发工具。
- Python方面,
- 精通于Python编程,掌握可变对象应用,命名空间范围,类的多态,模块及包开发等众多细致细节。 熟练使用诸如 numpy, pandas, matplotlib 等基本数据处理包,有使用Biopython, pysam等生物信息处理包处理fasta, bam等文件经验。 有处理大文件流,处理算法设计经验,了解基本机器学习的运作模式。
- R方面,
- 能根据官方文档进行数据分析脚本研发,如DESeq2, edgeR, Gviz, ChIPseeker, clusterProfiler, GOplot, ggplot2等包的使用及流程研发定义。
- 其他,
- 能修改阅读Perl/C/C++/JavaScript/HTML等编程语言脚本,具备基本的文档撰写及WEB开发能力。 能对未使用过的技术迅速模仿并运用改造,如有基于Typescript开发vscode插件的经验。 此外,还有mysql/Apache/ngnix等应用软件的使用经验。
- Linux方面,
-
生物信息方面
- 熟悉常见软件的使用,如 blast, bwa, bowtie, hisat2, samtools, bedtools 等。
- 基本的数据分析思维,并将其整理复用为从原始下机数据到最终分析报告呈现流程的开发经验,独立完成项目分析流程的研发。
- 文献/文档阅读能力,从中提取方法,针对个性化分析编写脚本进行数据处理个性化分析,如按照指定思路,对于无软件无流程的数据进行个性化分析。
-
个性
- 热爱新的挑战,无惧困难。 具有一定的创新能力,如对新软件,新流程,新包的使用,搜寻相应资料,撰写文档,测试研发。
项目:
-
一个关于奇偶探针的chirp-seq分析:
- 项目中,借助 bowtie2, macs2 对Chirp-seq数据进行比对,callPeak,借助 samtools depth 统计每bp的覆盖度,参考文献提出3种方案筛选置信度较高的Peak,分别为计算Peak区域 true base(两者每bp最低),true base 平均覆盖度 > 1.5, 皮尔逊相关性系数 > 0.3。
- 自己编写脚本实验Peak的筛选:
- 按照文章中 norml depth = 10M reads / totol reads 对于每bp的覆盖度进行标准化。
- 由于获得的depth文件过大,完全读入内存统计非常占用计算资源,造成统计的时间复杂度与空间复杂度都十分高,因此需要设计算法,滑窗统计区域算法设计,即随着文件的一次遍历,挨个获取统计每个Peak的depth的值,进行上述条件的计算。 并且解决了当向submit±2k拓展时,会造成比较区域重叠问题。
- 随后对这些Peak进行临近基因注释,并进行富集分析,最后汇总报告。
- 具体为:
- 设计区域统计算法,借助pandas,并进行每碱基的深度计算后,,自定义参考文献
-
本地版blast nt数据库构建及比对结果的物种学名占比比例统计。
- 比对后寻找序列对应物种学名及占比比例。wan230114/blastdb_nt-nr: blast nt nr db create and scientific name count.。使用了Biopython,pandans,matplotlib,numpy,pickle等包进行开发,实现从 fq/fa --> n条reads占比统计。并基于比对读取库占用较大IO的特性,对多文件多序列输入合并比对再分割的优化,大大节省了计算资源与运算时间,从10cpu比对6w序列耗时1小时降至30min。
- 项目共享地址:wan230114/blastdb_nt-nr: blast nt nr db create and scientific name count.。
- 实现技术:使用了Biopython,pandans,matplotlib,numpy,pickle等包进行开发,实现从 fq/fa --> n条reads占比统计。 并基于比对读取库占用较大IO的特性,对多文件多序列输入合并比对再分割的优化,大大节省了计算资源与运算时间,从10cpu比对6w序列耗时1小时降至30min。
-
各类标准分析流程的研发,报告与技术文档的构建,利用流程做的分析。R包实现模块化,在不同代码中使用source导入函数复用
-
公司产品线文档的组织搭建 *
其他项目:
- 一个基于 nextflow 的 meRIP pipeline 的内部代码解析