Методы селективного комбинирования признаковой информации в задаче оценивания регрессионной зависимости тема диссертации и автореферата по ВАК РФ 05.13.18, кандидат наук Нгуен Чонг Тинь
- Специальность ВАК РФ05.13.18
- Количество страниц 140
Введение диссертации (часть автореферата) на тему «Методы селективного комбинирования признаковой информации в задаче оценивания регрессионной зависимости»
ом задачи, в которой объем наблюдений меньше, чем доступный объем известной о них информации, является задача восстановления порядка сайтов в запросе поисковой машины. Основная сложность данной задачи состоит в том, что современные алгоритмы ранжирования зависят не только от наполнения веб-станиц, но и от поискового запроса, поэтому для восстановления алгоритмов ранжирования нельзя пользоваться данными разных запросов, а количество релевантных ссылок в одном запросе, как правило, не превосходит нескольких десятков. Еще одно ограничение современной теории обучения заключается в том, что она рассматривает искомую зависимость как зависимость между разными характеристиками одного объекта, молчаливо предполагая, что эти характеристики вносят одинаковый вклад в искомую зависимость. В то же время на практике характеристики, измеренные на различных объектах распознавания, не являются независимыми. Учет данного обстоятельства может служить мощным средством повышения качества анализа данных, выполняя роль инструмента регуляризации для изначально некорректных задач распознавания фрагментов сигналов, объектов на изображениях, функциональных сайтов в аминокислотных последовательностях белков. Поэтому актуальнейшей проблемой современного анализа данных является создание таких методов восстановления зависимостей, которые обладают способностью селективно комбинировать релевантную задаче
5
признаковую информацию в условиях небольшого размера обучающей выборки.
В-третьих, количество различных задач, которые можно рассматривать в рамках области восстановления зависимостей по эмпирическим данным, очень велико. В каждой из есть свои особенности, наблюдаемые переменные измеряются в различных шкалах. Например, в задаче анализа продолжительности жизни выходная переменная представляет собой время, а, следовательно, она должна быть неотрицательной. Кроме того, для анализа продолжительности жизни характерно наличие цензурированных наблюдений, затрудняющее применение обычных статистических и регрессионных методов. Цензурированием называют событие, приводящее к прекращению наблюдения за объектом до наступления события. Например, в процессе наблюдения за объектами, так как время наблюдения за объектом конечно, целевое событие наступает далеко не всегда. Но, не смотря на неполноту данных о таких объектах, их использование крайне желательно в силу того, что, как правило, в подобных задачах размер обучающей выборке невелик, а число признаков сопоставимо (или превосходит) количество объектов. В задачах, в которых объекты представляются не признаковыми, а различными потенциальными функциями, измеренными в различных модальностях, объем информации совершенно естественно превосходит само количество наблюдений. В задаче порядковой или ранговой регрессии выходная переменная имеет соответственно порядковую или ранговую природу. Несмотря на такое многообразие задач восстановления зависимостей, чрезвычайно заманчивой представляется возможность создания единой постановки для этих задач, наделенной способностью к селективному комбинированию признаковой информации.
Эти обстоятельства порождают фундаментальную проблему создания сквозной интеллектуальной информационной технологии нового поколения для анализа объектов реального мира с учетом их многомодального
6
представления, различных шкал измерения признаков и наблюдаемой переменной, работающей с данными различного объема, а также наделенной способностью отбирать релевантную признаковую информацию в итоговой комбинированной модели.
Целью работы является создание единого математического аппарата, численных методов и алгоритмов построения зависимостей по эмпирическим данным с учетом многомодального представления объектов, позволяющих селективно комбинировать разнородную признаковую информацию и получать зависимости, обладающие высокой обобщающей способностью для различных классов задач анализа данных.
Для достижения поставленной цели в диссертации сформулированы и решены следующие задачи:
Задача 1. Создание класса математических моделей зависимостей между переменными, измеряемыми в разнородных шкалах и методов их оценивания.
Задача 2. Создание методов комбинирования модальностей существенно разной природы в единой системе.
Задача 4. Разработка семейства достаточно общего класса моделей представления искомой закономерности, позволяющих осуществлять селективное комбинирование признаковой информации.
Задача 5. Исследование свойств оценок параметров, получаемых с помощью предложенной селективной иерархической вероятностной модели: селективности, несмещенности, состоятельности (построение оракульных неравенств), способности к отбору коррелированных регрессоров, непрерывность исследование верхней границы риска оценок.
Задача 6. Создание алгоритмов оценивания разработанных моделей селективности, применимых для различных задач анализа данных вне зависимости от вида связи модальностей в искомой зависимости: задачи линейной регрессии, задачи порядковой регрессии, задачи анализа
7
продолжительности жизни и многомодального восстановления регрессионной зависимости.
Задача 7. Экспериментальное исследование предложенной модели селективности для различных задач анализа данных.
Теоретические исследования, используемые в работе, основаны на применени метода максимального правдоподобия (принципа максимизации совместной апострериорной плотности), теории байесовских статистических решений, методов оптимизации, теории обучения машин. Комбинирование модальностей предполагает погружение всего множества объектов сразу в несколько линейных пространств, и рассмотрение в качестве общего пространства обучения их скалярного произведения.
Экпериментальные исследования осуществлены на модельных данных и известных реальных данных, и результаты экспериментов сравнены с передовыми мировыми аналогами для сравнительной оценки полученных результатов теоретических исследований.
Решение представленных задачи осуществляется в диссертации в следующих главах.
Во введении обоснована актуальность задачи селективого комбинирования признаковой информации оценивания регерессионной заваисимости, описана общая структура диссертации.
В первой главе рассмотрены общая постановка задачи восстановления зависимости. Рассмотрены аспекты, приводящие к необходимости отбора признаков в модели. Проанализированы существующие методы отбора признаков, рассмотрены их достоинства и недостатки, на основании которых обосновывается актуальность диссертационного исследования и формулируются основные задачи диссертации.
Во второй главе рассматривается ряд задач анализа данных, приводящих к проблеме переобучения и необходимости селекции признаковой информации. Осуществляется вероятностная постановка задач
8
линейной регрессии, порядковой регрессии, анализа продолжительности жизни и задачи многомодального восстановления регрессионной зависимости (задачи комбинирования потенциальных функций).
В третьей главе предлагается иерархическая вероятностная модель с регулируемой селективностью для восстановления зависимостей. Производится обоснование выбора априорной плотности распределения параметров модели, управляемой единственным структурным параметром. Селективность, являясь структурным параметром алгоритма обучения, влияет на сложность обучаемой модели и тем самым представляет собой инструмент борьбы с переобучением с целью повышения обобщающей способности при восстановлении зависимостей в признаковых пространствах большой размерности. Выбрать подходящий уровень селективности можно одним из стандартных методов, например, по контрольной выборке или с помощью процедуры скользящего контроля. Доказывается, что предложенный в диссертационной работе встроенный метод отбора признаков позволяет получать состоятельные, несмещенные оценки вектора коэффициентов, обладает способностью отбирать коррелированные регрессоры в определенной области пространства признаков и имеет конечную верхнюю оценку риска, т.е. в отличие от всех существующих методов обладает всеми свойствами идеальных в современном понимании оценок.
В четвертой главе рассмотрен общий алгоритм восстановления предложенной иерархической вероятностной модели и его модификации для различных вариантов модели наблюдения. Также даются .. оценки вычислительной сложности алгоритма для каждой конкретной задачи.
В пятой главе описывается экспериментальное исследование предложенного встроенного метода отбора признаков. Для сравнительного тестирования предложенного алгоритма, мы выбрали для каждой задачи
самые эффективные из существующих на данный момент встроенных методов. Эксперименты проводились на модельных и реальных данных.
Похожие диссертационные работы по специальности «Математическое моделирование, численные методы и комплексы программ», 05.13.18 шифр ВАК
Выпуклые критерии и параллелизуемые алгоритмы селективного комбинирования разнородных представлений объектов в задачах восстановления зависимостей по эмпирическим данным2013 год, кандидат наук Разин, Николай Алексеевич
Алгоритмы оценивания моделей нестационарных сигналов при наличии ограничений2003 год, кандидат физико-математических наук Красоткина, Ольга Вячеславовна
Методы обучения распознаванию образов в условиях нестационарности решающего правила2017 год, кандидат наук Турков Павел Анатольевич
Непараметрические методы анализа кластеров высокой плотности1999 год, доктор технических наук Коваленко, Андрей Петрович
Методы и алгоритмы взаимной реконструкции лицевых и голосовых данных2018 год, кандидат наук Олейник Андрей Леонидович
Заключение диссертации по теме «Математическое моделирование, численные методы и комплексы программ», Нгуен Чонг Тинь
ЗАКЛЮЧЕНИЕ
В работе предложена универсальная математическая методологии отбора признаков на основе байесовского похода в задаче оценивания регрессионной зависимости по эмпирическим данным. Процесс отбора признаков попутно непосредственно инкорпорирован в процесс обучения, в отличие от методов отбора признаков в переборных стратегиях. Отбор признаков выполняется с помощью соответствующих априорных предположений об искомых коэффициентах. Уровень селективности можно изменять общего структурного параметра.
Исследованы свойства оценок, получаемых с помощью предложенной вероятностной модели. Доказано, что модель восстановления регрессионной зависимости с регулируемой селективностью удовлетворяет требованиям несмещенности, состоятельности, непрерывности, селективности способен отбирать коррелированные регрессоры, обладает конечной верхней границей риска и удовлетворяет оракульным неравенствам.
Разработан итерационный алгоритм решения задачи восстановления модели линейной регрессии с регулируемой селективностью.
Разработан итерационный алгоритм решения задачи селективного комбинирования потенциальных функций при многомодальном восстановлении регрессионной зависимости.
Разработан итерационный алгоритм решения задачи восстановления регрессионной модели анализа продолжительности жизни с регулируемой селективностью.
Разработан итерационный алгоритм решения задачи восстановления модели порядковой регрессии с регулируемой селективностью.
Исследована вычислительная сложность предложенных алгоритмов. Показано, что их можно применять для большого числа признаков и больших обучающих выборок. В худшем случае, они равны вычислительной сложности системы линейных уравнений. Особенно они эффективны в
117
случае малого объема обучающей выборки и большого количества признаковых переменных.
Проведено экспериментальное исследование эффективности предложенных алгоритмов на модельных данных и реальных данных. Показано, что у них есть конкурирующая или меньшая ошибка оценки наблюдаемой переменной и более хорошая способность отбора признаков по сравнению с известными методами.
Список литературы диссертационного исследования кандидат наук Нгуен Чонг Тинь, 2013 год
СПИСОК ЛИТЕРАТУРЫ
1. Вапник В.Н. Восстановление зависимостей по эмпирическим данным. Москва, Наука 1979.
2. Воронцов К.В. Математические методы обучения по прецедентам (теория обучения машин)// http://www.machinelearning.ru/wiki/images/6/6d/Voron-ML-1 .pdf.
3. Галицкий Е.Б., Моттль В.В., Татарчук А.И. Обучение распознаванию образов в анализе данных опросов населения// ММРО-12, Москва 2005.
4. Де Гроот М. Оптимальные статистические реше-ния. // Москва: Мир, 1974.
5. Елисеев А. П., Моттль В. В., Татарчук А. И., Регулируемая селективность в многомодальдном распозвании образов. Таврический Вестник Информатики и Математики. №1 2009.
6. Мерков А.Б. Об анализе выживаемости // Лаборатория распознавания Московского Центра Непрерывного Математического Образования. 2006.
7. Моттль В.В., Середин О.С, Красоткина О.В. Комбинирование потенциальных функций при восстановлении зависимостей по эмпирическим данным //Искусственный интеллект-2'2004, с. 134-139.
8. Моттль В. В., Татарчук А. И., Елисеев А. П., Регулируемая селективность в многомодальном распознавании образов. Таврический вестник информатики и математики 2008 №2.
9. Сулимова В.В., В.В., Моттль, Середин О.С., Красоткина О.В. Комбинирование потенциальных функций при верификации личности по динамике подписи.
10. Татарчук А. И., Урлов Евгений Николаевич, Моттль В. В. Метод опорных потенциальных функций в задаче селективного комбинирования разнородной информации при обучении распознаванию образов // ММРО-14.
11. Татарчук А.И., Сулимова В.В., Моттль В.В. Метод релевантных потенциальных функций для селективного комбинирования разнородной
119
информации при обучении распознаванию образов на основе байесовского подхода // Доклады 14-й Всеросийской конференции «Математические методы распознавания образов».
12. Татарчук А.И., Урлов Е.Н., Моттль В.В. Метод опорных потенциальных функций в задаче селективного комбинирования разнородной информации при обучении распознавания образов // Доклады 14-й Всеросийской конференции «Математические методы распознавания образов».
13. Alan Miller (2002), Subset Selection in Regression, Chapman & Hall/'CRC
14. Alexander Tatarchuk, Eugene Urlov, Vadim Mottl, and David WindRidge. A Support Kernel Machine for Supervised Selective Combining of Diverse Pattern-Recognition Modalities. MCS'10 Proceedings of the 9th international conference on Multiple Classifier Systems, pp. 165-174.
15. Andreas Rosenwald, et. all. The use of molecular profiling to predict survival after chemotherapy for diffuse large-b-cell lymphoma //The New England Journal of Medicine. 2002. № 25 C. 1937 - 1947.
16. Antti Airola, Tapio Pahikkala, Tapio Salakoski An Improved Training Algorithm for the Linear Ranking Support Vector Machine Artificial Neural Networks and Machine Learning — ICANN 2011 Lecture Notes in Computer Science Volume 6791,2011, pp 134-141.
17. Bach F.R., Lankriet G.R.G., Jordan M.I. Multiple kernel learning, conic duality, and the SMO algorithm. Proceedings of the 21th International Conference on Machine Learning, Banff, Canada, 2004.
18. Beer, D. G., Kardia, S. L. R., Huang, С. C., Giordano, T. J.,Levin, A. M., Misek, D. E., Lin, L., Chen, G., Gharib, T. G., Thomas, D. G. et al. (2002). Geneexpression profiles predict survival of patients with lung adenocarcinoma. Nature medicine 8 816-824.
19. Bishop C.M., Tipping M.E. Variational relevance vector machines. In: C. Boutilier and M. Goldszmidt (Eds.), Proceedings of the 16th Conference on Uncertainty in Artificial Intelligence. Morgan Kaufmann, 2000, pp.46-53.
20. Bishop, C. (2006). Pattern Recognition and Machine Learning, Springer,New York.
21. Bradley Efron, Trevor Hastie, Iain Johnstone and Robert Tibshirani. Least Angle Regression // January 9,2003.
22. Breiman, L. (1995). Better subset regression using the nonnegative garrote. Technometrics,37(4):373-384.
23. Burges, C.J., Ragno, R., Le, Q.V.: Learning to rank with nonsmooth cost functions. In: Advances in Neural Information Processing Systems 19 (NIPS 2006), pp. 395-402 (2007).
24. Burges, C.J., Shaked, T., Renshaw, E., Lazier, A., Deeds, M., Hamilton, N., Hullender, G.: Learning to rank using gradient descent. In: Proceedings of the 22nd International Conference on Machine Learning (ICML 2005), pp. 89-96 (2005).
25. Cao Z., Xu J., Liu T.-Y., Li H., Huang Y., and Hon H.-W.. Adapting ranking SVM to document retrieval // Proc. of the 29th Int. Conference on Research and Development in Information Retrieval. ACM, NY, USA, pp. 186-193.
26. Chapelle O. and Keerthi S.S., Efficient algorithms for ranking with SVMs, Information Retrieval Journal, vol. 13, no. 3, pp. 201- 215,2010.
27. Chu, W., Keerthi, S.S.: New approaches to support vector ordinal regression. In: Proceedings of the 22nd International Conference on Machine Learning (ICML 2005), pp. 145-152 (2005).
28. Cohen, W.W., Schapire, R.E., Singer, Y.: Learning to order things. In: Advances in Neural Information Processing Systems (NIPS 1997), vol. 10, pp. 243270 (1998).
29. Cox D.R. Regression Models and Life-Tables // Jornal of the Royal Statistical Society. 1972. №2. C. 187-220.
30. Crammer, K., Singer, Y.: Pranking with ranking. In: Advances in Neural Information Processing Systems 14 (NIPS 2001), pp. 641-647 (2002).
31. Engler D and Li Y. 2009. Survival Analysis with High-Dimensional Covari-ates: An Application in Microarray Studies. Statistical Applications in Genetics and Molecular Biology.
32. Fan J, Lv J. A selective overview of variable selection in high dimensional feature space. // Statistica Sinica,2010. _ Vol. 20. _ Pp. 111-122.
33. Fan J. Comments on "Wavelets in statistics: A review" by A. Antoniadis. J. Italian Statist. Assoc. 1997; 6:131-138.
34. Fan, J., and Li, R. (2001), "Variable Selection via Nonconcave Penalized Likelihood and Its Oracle Properties," Journal of the American Statistical Association, 96, 1348-1360.
35. Fan,J. and Li,R. (2002) Variable selection for Cox's proportional hazards model and frailty model. Ann. Stat., 30, 74-99.
36. Faraggi, D. & Simon, R. (1998). Bayesian variable selection method for censored survival data. Biometrics 54, 1475-85.
37. Frank, I.E., and Friedman, J.H. (1993), "A Statistical View of Some Chemometrics Regression Tools," Technometrics,35, 109-148.
38. Freund, Y., Schapire, R.E.: A decision-theoretic generalization of online learning and an application to boosting. Journal of Computer and System Sciences 55(1), 119-139(1995)
39. Geng, X. B., Liu, T. Y., Qin, T., and Li, H. Feature Selectionfor Ranking. Proceedings of the 30th Annual International ACM SIGIR Conference, 2007. To appear.
40. George, E. (2000), The Variable Selection Problem," Journal of the American Statistical Association, 95,1304-1308.
41. Goeman, J. J. (2008) An efficient algorithm for LI-penalized estimation. Preprint, Department of Medical Statistics and Bioinformatics, Leiden University, Netherlands
42. Goeman, J. J. (2010). LI penalized estimation in the cox proportional hazards model. Biometrical Journal 52 70-84.
43. Gui, J., and Li, H. (2004), Penalized Cox Regression Analysis in the High-Dimensional and Low-sample Size Settings, with Applications to Microarray Gene Expression Data, http://repositories.cdlib.org/cbmb/LlCox/.
44. Guyon I. M., Gunn S. R., Nikravesh M., Zadeh L., Eds. Feature Extraction, Foundations and Applications. Springer, 2006.
45. Hanjiang Lai, Yan Pan, Cong Liu, Liang Lin, Jie Wu. Sparse Learning-to-Rank via an Efficient Primal-Dual Algorithm. IEEE Transactions on Computers, 2012.
46. Hastie T., Tibshirani, R. Generalized additive models // Chapman and Hall. 1990.
47. Hastie T., Tibshirani, R., Friedman J. The Elements of Statistical Learning. Springer, 2001. - 533 pp.
48. Herbrich, R., Obermayer, K., Graepel, T.: Large margin rank boundaries for ordinal regression. In: Advances in Large Margin Classifiers, pp. 115—132 (2000)
49. Hoerl, A. E. and Kennard, R. (1970). Ridge regression: biased estimation for nonorthogonal problems, Technometrics 12: 55-67.
50. Ibrahim, J. G., Chen, M.-H. & Maceachern, S. N. (1999). Bayesian variable selection for proportional hazards models. Can. J. Statist. 27, 701-17.
51. Insuk Sohn, Jinseog Kim, Sin-Ho Jung, Changyi Park. Gradient Lasso for Cox Proportional Hazards Model Bioinformatics Advance Access published May 15,2009.
52. Isabelle Guyon, André Elisseeff: An Introduction to Variable and Feature Selection. Journal of Machine Learning Research 3: 1157-1182 (2003)
53. Joachims T.. Optimizing search engines using clickthrough data // Proc. ACM Conference on Knowledge Discovery and Data Mining(KDD '02), pp. 133142, 2002.
54. Kolmogorov A.N., Fomin S.V. Introductory Real Analysis. Prentice-Hall, Englewood Cliffs, 1970.
55. Kramer, S., G. Widmer, B. Pfahringer, and M. DeGroeve. Prediction of ordinal classes using regression trees. Fundamenta Informaticae, 47:1-13,2001.
56. Kyeong E. L., Bani K. M. Bayesian Methods for gene Selection in the Survival Model with Application to DNA Microarray data. The Indian Journal of Statistics (2003-2007) © 2004 Indian Statistical Institute.
57. Lanckriet G.R.G., Cristianini N., Ghaoui L.E., Bartlett P., Jordan M.I. Learning the kernel matrix with semideflnite programming. J. Machine Learning Research, 5,2004, pp. 27-72.
58. Leeb H, Potscher BM (2008) Sparse estimators and the oracle property, or the return of Hodges' estimator. J Econom 142:201-211
59. Mark Schmidt. Least Squares Optimization with LI-Norm Regularization. December 2005.
60. Michael E Tipping. The Relevance Vector Machine.Advances in Neural Information Processing Systems 12. CambRidge, Mass:MIT Press, 2000. To appear.
61. Michael E. Tipping Sparse Bayesian Learning and the Relevance Vector Machine.
62. Mottl V. Metric spaces admitting linear operations and inner product. Doklady Mathematics 67(1), 2003, 140-143.
63. Mottl V., Lange M., Sulimova V., Yermakov A.. Signature verification based on fusion of on-line and off-line kernels. In 19th International Conference on Pattern Recognition (ICPR 2008), December 8-11, 2008, Tampa, Florida, USA. pages 1-4, IEEE, 2008.
64. Mottl V., Sulimova V., Tatarchuk A. Multi-kernel approach to on-line signature verification. In: Proceedings of the Eighth IASTED International Conference on Signal and Image Processing, held August 14 - 16, 2006, Honolulu, Hawaii, USA, pp. 448-453.
65. Mottl V., Tatarchuk A., Sulimova V., Krasotkina O., SeredinO. Combining Pattern Recognition Modalities at the Sensor Level Via Kernel Fusion, In: Proceedings of 7th International Workshop Multiple Classifiers Systems, Prague, Czech Republic, pp. 1-12, LNCS 4472, Springer-Verlag, Berlin, Heidelberg (2007).
66. Mottl V.V., Seredin O.S., Krasotkina O.V., and Muchnik I.B. Fusing of potential functions in reconstructing dependences from empirical data In: Doklady Mathematics, Vol. 71, No. 2, 2005, pp. 315-319. FromDokla-dy Akademii Nauk, Vol. 401, No. 5,2005, pp. 607-612.
67. Mottl V.V., Seredin O.S., Krasotkina O.V., and Muchnik I.B. Principles of multi-kernel data mining. In: P. Perner and A. Imiya (Eds.), Machine Learning and Data Mining in Pattern Recognition, SpringerVerlag, LNAI 3587, 2005, pp. 52 -61.
68. Mottl V.V., Seredin O.S., Krasotkina O.V., and Muchnik I.B. Kernel fusion and feature selection in machine learning. Proceedings of the eighth IASTED International Conference Intelligent Systems and Control, October 31 - November 2, 2005, CambRidge, USA, pp.477-482.
69. Mottl V.V., Seredin O.S., Krasotkina O.V., Muchnik I.B. Fusion of Euclidian metrics in featureless data analysis: an equivalent of the classical problem of feature selection In: Proceedings of 7th International Conference on Pattern Recognition and Image Analysis, PRIA-7-2004, St. Petersburg, October, 2004, pp.94-97.
70. Noah Simon, Jerome Friedman, Trevor Hastie, Rob Tibshirani. Regulariza-tion Paths for Cox's Proportional Hazards Model via Coordinate Descent. Journal of Statistical Software March 2011, Volume 39, Issue 5.
71. Park MY, Hastie T (2007a). Ll-Regularization Path Algorithm for Generalized Linear Models. Journal of the Royal Statistical Society B, 69, 659-677.
72. Piatt, John. Fast Training of Support Vector Machines using Sequential Minimal Optimization, in Advances in Kernel Methods - Support Vector Learning, B. Scholkopf, C. Burges,A. Smola, eds., MIT Press (1998).
73. Rakotomamonjy, A., Bach, F., Canu, S., Grandvalet, Y. Simple MKL. Journal of Machine Learning Research.
74. Rennie, J.D.M., Srebro, N.: Loss functions for preference levels: regression with discrete ordered labels. In: IJCAI 2005 Multidisciplinary Workshop on Advances in Preference Handling. ACM, New York (2005).
75. Rigutini, L., Papini, T,, Maggini, M., Scarselli, F.: Learning to rank by a neural-based sorting algorithm. In: SIGIR 2008 Workshop on Learning to Rank for Information Retrieval (LR4IR 2008) (2008).
76. Ross A., Jain A.K.: Multimodal biometrics: an overview. In: Proceedings of the 12th European Signal processing Conference (EUSIPCO 2004), Vienna, Austria, pp. 1221-1224 (2004).
77. Schifano, E. D.; Strawderman, R. L.; Wells, M. T. Majorization-minimization algorithms for nonsmoothly penalized objective functions. Electronic Journal of Statistics. 2010,4, 1258-1299.
78. Segal,M.R. (2006) Microarray gene expression data with linked survival phenotypes: diffuse large-B-cell lymphoma revisited. Biostatistics, 7,268-285.
79. Sha, N., Tadesse, M. G. and Vannucci, M. (2006). Bayesian variable selection for the analysis of microarray data with censored outcomes. Bioinformatics 22 2262-2268.
80. Shashua, A., Levin, A.: Ranking with large margin principles: two approaches. In: Advances in Neural Information Processing Systems 15 (NIPS 2002), pp. 937-944 (2003)
81. Simon, N., Friedman, J., Hastie, T. and Tibshirani, R. (2011). Regularization Paths for Cox's Proportional Hazards Model via Coordinate Descent. Journal of Statistical Software 39 1-13.
82. Slawski, M., zu Castell, W. and Tutz, G. (2009). Feature Selection Guided by Structural Information, The Annals of Applied Statistics, to appear.
83. Sonnenburg S., Rätsch G., Schäfer C. A general and efficient multiple kernel learning algorithm. Proceedings of the 19th Annual Conference on Neural Information Processing Systems, Vancouver, Canada, December 5-8,2005.
84. Suhrid Balakrishnan, David Madigan. Priors on the Variance in Sparse Bayesian Learning.
85. Sulimova, V., Mottl, V., Tatarchuk, A.: Multi-kernel approach to on-line signature verification. In: Proceedings of the 8th IASTED International Conference on Signal and Image Processing, Honolulu, Hawaii, USA, August 14-16 (2006).
86. Tatarchuk, A., Mottl, V., Eliseyev, A., WindRidge, D.: Selectivity supervision in combining pattern-recognition modalities by feature- and kernel-selective Support Vector Machines. In: Proceedings of the 19th International Conference on Pattern Recognition, Tampa, USA, December 8-11 (2008).
87. Tatarchuk, A., Sulimova, V.,WindRidge, D., Mottl, V., Lange, M.: Supervised selective combining pattern recognition modalities and its application to signature verification by fusing on-line and off-line kernels. In: Benediktsson, J.A., Kittler, J., Roli,F. (eds.) MCS 2009. LNCS, vol. 5519, pp. 324-334. Springer, Heidelberg (2009).
88. Tibshirani, R. (1996). Regression shrinkage and selection via the lasso, Journal of the Royal Statistical Society, Series B 58: 267-288.
89. Tibshirani, R. The lasso method for variable selection in the Cox model. Statistics in Medicine 1995; 16(4):385 -395.
90. Tibshirani, R., Saunders, M., Rosset, S., Zhu, Z., and Knight, K. (2005), Sparsity and smoothness via the fused lasso," J. R. Statist. Soc. (B), 67, 91-108.
91. Tie-Yan Liu (2009), Learning to Rank for Information Retrieval, Foundations and Trends in Information Retrieval: Vol. 3: No 3, cc. 225-331.
92. Tie-Yan Liu, Jun Xu, Tao Qin, Wenying Xiong, and Hang Li. LETOR: Benchmark Collection for Learning to Rank for Information Retrieval. SIGIR 2007 Workshop on Learning to Rank for Information Retrieval (LR4IR 2007).
93. Tsai, M.-F., Liu, T.-Y., Qin, T., Chen, H.-H., Ma,W.-Y.: Frank: a ranking method with fidelity loss. In: Proceedings of the 30th Annual International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2007), pp. 383-390 (2007).
94. van Houwelingen,H.C. et al. (2006) Cross-validated Cox regression on microarray gene expression data. Stat. Med., 25, 3201-3216.
95. Verweij PJM, van Houwelingen HC. Penalized likelihood in Cox regression. Statistics in Medicine 1994; 13:2427-2436.
96. Vladimir N. V An Overview of Statistical Learning Theory // IEEE Transactions on Neural Network,, 1999, V. 10, N. 5, P. 988-999.
97. Wu T, Lange K (2008). Coordinate Descent Procedures for Lasso Penalized Regression.The Annals of Applied Statistics, 2(1), 224-244.
98. Yang, Y. and Zou, H. (2012), A Cocktail Algorithm for Solving The Elastic Net Penalized Cox's Regression in High Dimensions Statistics and Its Interface., Statistics and Its Interface.
99. Zhang, H. H. and Lu, W. (2007) Adaptive lasso for Cox's proportional hazards model. Biometrika, 94, 691-703.
100. Zheng, Z., Chen, K., Sun, G., Zha, H.: A regression framework for learning ranking functions using relative relevance judgments. In: Proceedings of the 30th Annual International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2007), pp. 287-294 (2007).
101. Zou H. The adaptive LASSO and its oracle properties. J. Amer. Statist. Assoc. 2006; 101:1418-1429.
102. Zou, H. and Hastie, T. (2005). Regularization and variable selection via the elastic net, Journal of the Royal Statistical Society Series B. 67(2): 301320.
103. Zou, H., Zhang, H.H., 2009. On the adaptive elastic-net with a diverging number of parameters. The Annals of Statistics 37, 1733-1751.
104. Zou, H. and Li, R. (2008). One-step sparse estimates in nonconcave penalized likelihood models. The Annals of Statistics, 36:1509-1533.