进一步了解并行 LINQ

  • Jonathan Allen
  • 陈黎夫

2007 年 9 月 30 日

话题:.NET语言 & 开发架构

LINQ(Language Integrated Query)是 Visual Studio 2008 中的领军人物。借助于 LINQ 技术,我们可以使用一种类似 SQL 的语法来查询任何形式的数据。目前为止 LINQ 所支持的数据源有 SQL Server、XML 以及内存中的数据集合。开发人员也可以使用其提供的扩展框架添加更多的数据源,例如 MySQL、Amazon 甚至是 Google Desktop。

一般来讲,这类查询语句的一个重要特点就是可以并行化执行。虽然有些情况下并行可能会带来一些问题,但这种情况非常少见。这样也就水到渠成地引出了 PLINQ 这个并行处理的 LINQ 类库。

PLINQ 原名为 Parallel LINQ,支持 XML 和内存中的数据集合。执行于远程服务器上的查询语句(例如 LINQ to SQL)显然无法实现这个功能。

将 LINQ 语句转换为 PLINQ 语句极为简单——只需要在查询语句中 From 子句所指定的数据源的最后添加.AsParallel() 即可。随后 Where、OrderBy 和 Select 子句将自动改为调用这个并行的 LINQ 版本。

MSDN Magazine介绍,PLINQ 可以以三种方式执行。第一种是管道处理:一个线程用来读取数据源,而其他的线程则用来处理查询语句,二者同步进行——虽然这个单一的消费线程可能并不那么容易与多个生产线程同步。不过若是能够仔细配置好负载平衡的话,仍然会极大地减少内存占用。

第二种模式叫做“stop and go”,用于处理结果集需要被一次返回时(例如调用 ToList、ToArray 或对结果排序)的情况。在这种模式下,将依次完成各个处理过程,并将结果统一返回给消费线程。这个模式在性能上将优于第一种模式,因为它省去了用来保持线程同步所花费的开销。

最后一种方法叫做“inverted enumeration”。该方法并不需要实现收集到所有的输出,然后在单一的线程中处理,而是将最终调用的函数通过 ForAll 扩展传递到每个线程中。 这是目前为止最快的一种处理模式,不过这需要传递到 ForAll 中的函数是线程安全的,且最好不包含任何 lock 之类的互斥语句。

若是 PLINQ 中任意的一个线程抛出异常,那么所有的其他线程将会被终止。若是抛出了多个异常,那么这些异常将被组合成一个 MultipleFailuresException 类型的异常,但每个异常的调用堆栈仍会被保留。

查看英文原文:More on Parallel LINQ

.NET语言 & 开发架构