TGTGInsightтелеграм анализLIVE / telegram public index
← Такты, стеки, два колеса

TGINSIGHT SIMILAR POSTS

Намери подобно съдържание

Изходен канал @clockstackwheels · Post #672 · 28.11

Впервые сделал крупный проект (под NDA, так что не расскажу, какой) на облачных функциях. Впечатления противоречивые. Изначально программисты арендовали компьютер в датацентре: или целиком или кусочек. На нём теоретически можно делать что угодно, но для запуска своих программ нужно было настроить операционную систему, безопасность и авторизацию, установить нужные исполнительные модули, программы для удобства деплоя, мониторинг нагрузки итд. Поэтому появились сервисы, которые это всё делают за тебя, а тебе дают буквально окно, куда можно написать свой код и запускать его удалённо на чужой машине. Конкретно я пользовался решением от Яндекса, чей протокол скопирован напрямую с Amazon Web Services. Причём, в документации не только открыто об этом говорится, но ещё и в некоторых местах перенаправляют на доки от Amazon. И SDK предлагают тоже использовать амазоновский. До санкций я бы сказал, что это не так плохо — можно использовать что-то привычное тем, кто уже работал с Amazon. Но сейчас привязка к американскому сервису выглядит скорее жирным минусом. Не знаю, есть ли у Яндекса ресурсы на какое-то серьёзное разделение. Судя по состоянию документации и платформы в целом — нет. Yandex Cloud кажется системой, которая активно развивалась несколько лет назад, а сейчас подзаброшена. Среда выполнения .NET отстаёт от актуальной на две версии (3.1 вместо 6, четвёртой версии не существует). Изначально мой проект был написан как обычное контейнеризированное приложение на .NET 6, а потом я переводил его на функции. Пришлось пройтись по всему коду и переписать несовместимые куски с C#10 на C#8, это было не слишком приятно. Документации фактически нет, а там, где есть, много путаницы. В примерах написано одно, по факту другое: например в функцию вместо объекта Request приходит просто строка, а разбирать её надо самому. Авторизацию я нашёл только на Stackoverflow. Интересно, что адекватных доков про неё не было ни у Яндекса, ни у Amazon. Функция выполняется и выгружается, поэтому ваша программа не должна рассчитывать на наличие постоянно живущего процесса. Мне пришлось вытащить из неё большой словарь, который грузится при старте, и положить уже подготовленные данные из него в Object Storage — это такое горячее файловое хранилище, там же рядом с функциями. Справедливости ради, работает это всё быстрее, чем я думал. Удалось запихнуть в функции даже сравнительно большой проект с кучей классов, создающий при запуске несколько десятков объектов и производящий загрузку из сети с декомпрессией. Другой важный плюс — бесплатная квота довольно внушительная: миллион вызовов и 10Гб*часов оперативной памяти в месяц. Для пет проекта вы сможете вообще не покупать сервер. Но если сервер у вас всё-таки есть, деплой вы уже настроили, то удобнее будет, конечно, делать как привычно. И гибкости больше. #dev

Hashtags

Резултати

Намерени 3 подобни публикации

Търсене: #hdfs

当前筛选 #hdfs清除筛选
Data Science Jobs

@datasciencejobs · Post #2288 · 29.08.2024 г., 18:33

#job#работа#vacancy#вакансия#Data engineer #DataScience#HDFS#PySpark #Python#удаленно Вакансия: Data engineer Формат: Удаленно Занятость: полная, 5/2 (гибкое начало дня) З/П: до 300 000 руб. 🔶Эта вакансия - отличная возможность для инженера данных стать часть вдохновленной команды и принять участие в развитии платформы машинного обучения дочерней компании 🔶 Ключевая задача: развитие платформы машинного обучения 🔶Основные обязанности •Разрабатывать отчетность с использованием скриптов на PySpark •Генерировать новые признаки для ML-моделей •Автоматизировать процессы для бизнеса 🔶Обязательные требования: •Опыт работы с большими данными: HDFS, PySpark от 1 года •Опыт работы с Python, в том числе с Pandas, NumPy Преимуществом при отборе будет •Опыт работы с геоданными, git 🔶 Что мы можем предложить взамен •Место работы: удаленно по РФ •Трудоустройство по ТК РФ в аккредитованное юр. лицо •Официальное трудоустройство •Размер заработной платы обсуждается после собеседования •Годовое премирование •ДМС со стоматологией •Компенсация мобильной связи •Возможности для развития 📲Контакт: @Oskar17

Data Science Jobs

@datasciencejobs · Post #2934 · 20.09.2025 г., 07:03

#вакансия#datascientist#llm#nlp#HDFS#Kafka#Spark#удалёнка Ищем Senior Data Scientist в команду Поиск 3.0. Сейчас направление фокусируется на развитии Циан-помощника (наш LLM агент), делая его умнее и полезнее для всех пользователей и развитии текстового поиска, внедряя в него современные NLP и мультимодальные механики. Полная удалёнка внутри РФ. Если есть желание ходить в офис, у нас есть замечательные современные офисы в Москве, Питере и Новосибе. Вилка - от 350 до 500, готовы обсуждать. О нас: В Циан большая команда ML. В команде настроены процессы перфоманс ревью, регулярного обмена опытом, выделяем время на исследовательскую работу! Сейчас направление фокусируется на развитии текстового поиска, чтобы пользователи находили идеальные варианты быстрее, и Циан-помощнике, делая его умнее и полезнее. Задачи: * NLP задачи как в виде обучения моделей, так и в виде разработки вспомогательных сущностей на python * Внедрение мультимодального подхода к поиску * Развитие интеллектуального помощника по поиску недвижимости: обучение собственных llm моделей на базе opensource, исследование готовых решений от openAI/Yandex и других. * Разработка и внедрение в продакшн моделей машинного обучения для улучшения пользовательского опыта Требования: * Опыт: Не менее 3х лет релевантного опыта на позиции DS в продуктовой компании * Python: пишет легко читаемый и поддерживаемый код * SQL (оконные функции, оптимизация запросов) * Опыт в DL: обучение/дообучение собственных глубоких нейросетей * Опыт разработки NLP моделей: от tfidf до llm * Классический ML: бустинги, линейные модели. Будет плюсом: * Apache стек: HDFS/Kafka/Spark (DF API) * Опыт работы с CV и мультимодальными моделями Бонусы: ДМС с первого дня (стоматология, госпитализация, полис ВЗР), Кафетерий льгот, 5 day off в год, помимо основного отпуска. Контакты: По всем вопросам и с резюме пишите @mistakef Не забудьте указать, что вы из datasciencejobs

GitHub Trends

@githubtrending · Post #15246 · 24.10.2025 г., 13:30

#go#blob_storage#cloud_drive#distributed_file_system#distributed_storage#distributed_systems#erasure_coding#fuse#hadoop_hdfs#hdfs#kubernetes#object_storage#posix#replication#s3#s3_storage#seaweedfs#tiered_file_system SeaweedFS is a fast, simple, and highly scalable distributed file system designed to store billions of files and serve them quickly, especially small files. It uses a master server to manage volumes on volume servers, which handle file data and metadata, enabling very fast file access with minimal disk reads. It supports features like replication, erasure coding, cloud integration for elastic storage, and compatibility with many metadata stores and APIs including Amazon S3. This means you get efficient, cost-effective storage with fast access, easy scaling, and flexible deployment options for large-scale file storage needs. https://github.com/seaweedfs/seaweedfs