Фрагмент звёздного неба спроецирован на плоскость с декартовой системой координат.
Учёный решил провести кластеризацию полученных точек, являющихся изображениями звёзд, то есть разбить их множество на N непересекающихся непустых подмножеств (кластеров), таких что точки каждого подмножества лежат внутри прямоугольника со сторонами длиной H и W, причём эти прямоугольники между собой не пересекаются.
Стороны прямоугольников не обязательно параллельны координатным осям.
Гарантируется, что такое разбиение существует и единственно для заданных размеров прямоугольников.
Будем называть центром кластера точку этого кластера, сумма расстояний от которой до всех остальных точек кластера минимальна.
Для каждого кластера гарантируется единственность его центра.
Расстояние между двумя точками на плоскости A(x1, y1) и B(x2, y2) вычисляется по формуле:
d(A, B) = √((x2 - x1)² + (y2 - y1)²)
Каждая звезда помимо координат на плоской карте характеризуется своим спектральным классом и классом светимости.
Спектральный класс определяет цвет (который связан с температурой звезды) согласно таблице.
Каждый из спектральных классов, в свою очередь, делится на подклассы от 0 до 9 в порядке уменьшения температуры.
Обозначение подкласса ставится после обозначения спектрального класса (например, B2).
Класс светимости звезды обозначим римскими цифрами от I до VII.
| Обозначение |
Цвет |
Обозначение |
Размер |
| O |
голубой |
I |
сверхгигант |
| B |
бело-голубой |
II |
яркий гигант |
| A |
белый |
III |
гигант |
| F |
жёлто-белый |
IV |
субгигант |
| G |
жёлтый |
V |
карлик |
| K |
оранжевый |
VI |
субкарлик |
| M |
красный |
VII |
белый карлик |
В файле A хранятся данные о звёздах двух кластеров, где H=6,0, W=5,5 для каждого кластера.
В каждой строке записана информация о расположении на карте одной звезды: сначала координата x, затем координата y.
Далее в той же строке для звёзд классов светимости I–VI указываются спектральный класс, подкласс и класс светимости.
Обозначения классов ничем не разделяются.
Для звёзд класса светимости VII (белый карлик) обозначения спектрального класса и подкласса в файле не указываются.
Известно, что количество точек не превышает 2000.
В файле B хранятся данные о звёздах трёх кластеров, где H=6,0, W=5,5 для каждого кластера.
Известно, что количество звёзд не превышает 10 000.
Структура хранения информации о звёздах в файле B аналогична файлу A.
Для файла A определите координаты центра каждого кластера, затем найдите два числа:
- Ax — абсциссу красного гиганта, ближайшего к центру кластера, который содержит наименьшее количество точек.
- Ay — ординату красного гиганта, ближайшего к центру кластера, который содержит наименьшее количество точек.
Для файла B определите координаты центра каждого кластера, затем найдите два числа:
- B1 — расстояние между центрами кластеров с наименьшим и наибольшим количеством оранжевых гигантов.
- B2 — наибольшее расстояние между жёлтыми карликами одного кластера.
В ответе запишите четыре числа:
- в первой строке — сначала целую часть абсолютного значения произведения Ax × 10 000, затем целую часть абсолютного значения произведения Ay × 10 000;
- во второй строке — сначала целую часть произведения B1 × 10 000, затем целую часть произведения B2 × 10 000.
Пример организации данных в одном из исходных файлов для случая четырёх звёзд:
5,01788 8,32466 G2V 4,289251 6,955186 VII 4,619358 5,524697 B7V 6,91934 20,425391 G2V
Внимание!
Пример приведён в иллюстративных целях для произвольных значений, не имеющих отношения к заданию.
Для выполнения задания используйте данные из прилагаемых файлов.
Решение 1. Спектральная кластеризация
Шаг 1. Открываем данные
f = open("27_A.txt")
#f = open("27_B.txt")
В начале программы указаны имена файлов для Pyodide.
Шаг 2. Читаем координаты
from math import hypot
Каждая непустая строка даёт одну точку на плоскости.
Шаг 3. Медоид
def read_stars(path):
stars = []
for line in open(path, encoding="utf-8"):
line = line.strip().replace("\t", " ")
if not line:
continue
parts = line.split()
stars.append({
"x": float(parts[0].replace(",", ".")),
"y": float(parts[1].replace(",", ".")),
"spec": "".join(parts[2:]),
})
return stars
def medioid(stars):
best = stars[0]
best_sum = 10 ** 18
for s in stars:
total = sum(hypot(s["x"] - t["x"], s["y"] - t["y"]) for t in stars)
if total < best_sum:
best_sum = total
best = s
return best
Медоид устойчивее среднего арифметического к выбросам.
Шаг 4. Радиусная компонента
def is_red_giant(spec):
return (spec.startswith("M") or spec.startswith("Y")) and "III" in spec
Алгоритм похож на «заливку» связных компонент по расстоянию.
Шаг 5. Выбор радиуса
def is_orange_giant(spec):
return (spec.startswith("K") or spec.startswith("N")) and "III" in spec
Радиус подбирают так, чтобы число крупных компонент совпало с условием.
Шаг 6. Крупнейшие кластеры
def is_yellow_dwarf(spec):
return (spec.startswith("G") or spec.startswith("Z")) and spec.endswith("V")
Мелкие компоненты отбрасываем как шум.
Шаг 7. Центры кластеров
def cluster(stars, file_name):
clusters = {}
for star in stars:
x, y = star["x"], star["y"]
if file_name.endswith("A.txt"):
k = 1 if y > 9 else 0
else:
if y > 15 and x > 20:
k = 0
elif y > 12:
k = 1
else:
k = 2
clusters.setdefault(k, []).append(star)
return clusters
Центр — одна из точек кластера.
Шаг 8. Ответ для файла A
def solve_a(stars):
clusters = cluster(stars, "27_A.txt")
small = min(clusters, key=lambda k: len(clusters[k]))
center = medioid(small)
reds = [s for s in small if is_red_giant(s["spec"])]
nearest = min(reds, key=lambda s: hypot(s["x"] - center["x"], s["y"] - center["y"]))
return int(abs(nearest["x"]) * 10000), int(abs(nearest["y"]) * 10000)
def radius_clusters(stars, r):
rem = stars[:]
clusters = []
while rem:
cl = [rem.pop(0)]
i = 0
while i < len(rem):
if any(hypot(rem[i]["x"] - q["x"], rem[i]["y"] - q["y"]) <= r for q in cl):
cl.append(rem.pop(i))
else:
i += 1
clusters.append(cl)
return clusters
Формулы A берутся из условия варианта.
Шаг 9. Ответ для файла B
def solve_b(stars):
main = sorted(radius_clusters(stars, 3), key=len, reverse=True)[:3]
centers = [medioid(c) for c in main]
orange = [sum(1 for s in c if is_orange_giant(s["spec"])) for c in main]
mi = orange.index(min(orange))
ma = orange.index(max(orange))
b1 = int(hypot(centers[mi]["x"] - centers[ma]["x"], centers[mi]["y"] - centers[ma]["y"]) * 10000)
b2 = 0
for cluster in main:
yellows = [s for s in cluster if is_yellow_dwarf(s["spec"])]
for i in range(len(yellows)):
for j in range(i + 1, len(yellows)):
d = int(hypot(yellows[i]["x"] - yellows[j]["x"], yellows[i]["y"] - yellows[j]["y"]) * 10000)
b2 = max(b2, d)
return b1, b2
Формулы B — из второй части условия.
Шаг 10. Запуск и проверка
print(*solve_a(read_stars("27_A.txt")))
print(*solve_b(read_stars("27_B.txt")))
Ожидаемый ответ смотрите в карточке варианта.