TGTGInsighttelegram intelligenceLIVE / telegram public index
← Python Заметки

TGINSIGHT SIMILAR POSTS

Најди сличен содржај

Изворен канал @pythonotes · Post #309 · 2 фев.

Метод строки split() разделяет строку на несколько строк по указанному символу >>> "a_b_c".split('_') ['a', 'b', 'c'] Можно указать максимальное количество разделений >>> "a_b_c".split('_', 1) ['a', 'b_c'] Или резать с другой стороны с помощью rsplit() (right split) >>> "a_b_c".rsplit('_', 1) ['a_b', 'c'] А что будет если оставить аргументы пустыми? >>> "a_b_c".split() ['a_b_c'] Получаем список с одним элементом, потому что по умолчанию используется пробельный символ. >>> "a b c".split() ['a', 'b', 'c'] То есть это равнозначно такому вызову? >>> "a b c".split(" ") ['a', 'b', 'c'] Кажется да, но нет! Давайте попробуем добавить пробелов между буквами >>> "a b c".split(" ") ['a', '', '', 'b', '', '', 'c'] И вот картина уже не так предсказуема 😕 А вот что будет по умолчанию >>> "a b c".split() ['a', 'b', 'c'] Всё снова красиво! 🤩 По умолчанию в качестве разделителя используется любой пробельный символ, будь то табуляция или новая строка. Включая несколько таких символов идущих подряд. А также игнорируются пробельные символы по краям строки. >>> "a\t b\n c ".split() ['a', 'b', 'c'] Аналогичный способ можно собрать с помощью регулярного выражения. Но пробелы по краям строки придется обрабатывать дополнительно. >>> import re >>> re.split(r"\s+", ' a b c '.strip()) ['a', 'b', 'c'] Здесь тоже можно указать количество разделений >>> re.split(r"\s+", 'a b c', 1) ['a', 'b c'] А что если мы хотим написать красиво, то есть split() без аргументов, но при этом указать количество разделений? В этом случае первым аргументом передаём None >>> "a\n b c".split(None, 1) ['a', 'b c'] Данный метод не учитывает строки с пробелами, взятые в кавычки 'a "b c" '.split() ['a', '"b', 'c"'] Но для таких случаев есть другие способы. #tricks#basic

Резултати

Пронајдени 2 слични објави

Пребарај: #matching

当前筛选 #matching清除筛选
Data Science Jobs

@datasciencejobs · Post #2751 · 04.06.2025 г., 14:15

#Senior#DataScientist#ML#NLP#LLM#VLM#matching#DS#fulltime#ecommerce Senior Data Scientist (NLP/LLM/VLM) 💼 Ozon Tech 💰 От 455 000 ₽ gross совокупный доход Команда занимается развитием автоматического матчинга — технологии поиска одинаковых товаров как внутри Ozon, так и между Ozon и другими маркетплейсами. В работе — масштабные проекты с использованием LLM, NLP и VLM, направленные на повышение точности и полноты поиска дубликатов и объединения товарных карточек. Основные задачи: — Аналитика текущих проблем матчинга; — Обучение новых NLP-моделей (bi-encoder, late fusion, early fusion); — Адаптация новых LLM/VLM-моделей. Требования: — 4+ лет коммерческого опыта в Data Science; — 2+ года — в задачах NLP; — Опыт обучения и вывода ML-моделей в прод; — Знание современных и классических NLP-подходов; — Уверенное владение Python и PySpark (bigdata датасеты собираем на Hadoop-кластере); — Знание алгоритмов и структур данных; — Проактивность, ответственность, нацеленность на результат. Будет плюсом: — Участие в ML-соревнованиях; — Опыт построения протоколов и пайплайнов разметки данных; — Опыт работы с задачами матчинга / entity resolution. Что предлагаем: — Динамичный и быстроразвивающийся бизнес, ресурсы, возможность сделать вместе лучший продукт на рынке e-commerce; — Свобода решений, внимание к качеству инженерии; — Сильную профессиональную команду; — Возможность развиваться вместе с бизнесом; — От 455 000 ₽ gross совокупный доход. 📩Контакт: [email protected] — присылай резюме, обсудим детали.